预注册研究:极端反应风格在Likert型量表与视觉模拟量表间具有跨格式普遍性
一项预注册被试内研究(N = 501)让参与者以7点Likert型量表和视觉模拟量表(VAS)完成HEXACO-PI-R,并用贝叶斯框架联合建模。结果显示,两种格式上的极端反应风格(ERS)高度相关(ρERS = .76,95% CrI [.68, .83]),表明ERS在相当程度上跨反应格式普遍存在。因此,选用VAS并不能规避反应风格的影响,VAS数据同样需要对其建模。
一项预注册被试内研究(N = 501)让参与者以7点Likert型量表和视觉模拟量表(VAS)完成HEXACO-PI-R,并用贝叶斯框架联合建模。结果显示,两种格式上的极端反应风格(ERS)高度相关(ρERS = .76,95% CrI [.68, .83]),表明ERS在相当程度上跨反应格式普遍存在。因此,选用VAS并不能规避反应风格的影响,VAS数据同样需要对其建模。
针对小样本下 IRT 模型估计不稳定的问题,研究者提出将小样本估计视为不适定决策问题,并用神经网络构建从观测到参数的连续映射加以正则化,相关方法被形式化为"正则化决策理论"框架。以 3PL 模型为例的模拟研究考察了该方法的性质。该预印本尚未经同行评审。
心理科学方法与实践进展刊文介绍 Dyadic——一个面向人类—人类与人类—AI 对话研究的可扩展平台,旨在解决现有对话研究工具模块化不足、难以适应研究者需求的问题。该平台用于缓解对话研究中的诸多限制。
一项发表于 Nature Neuroscience 的研究提出新型 fMRI 技术 SORDINO,通过匀速旋转采集数据,将扫描噪声降至机器空闲水平,并在小鼠移动时仍能获得清晰图像。Shih 团队用其扫描清醒小鼠的静息态活动、抓取食物的运动任务及两只动物互动时的脑活动,并降低了电磁干扰,使其更易与电生理等技术同步。研究者正推动该技术向人类转化,以用于对噪声敏感或难以保持静止的人群。
决策研究领域首个共享的主观评价评分数据库Liking Initiative发布,汇集38项研究、59个数据集的759,399条个体评分,覆盖2,217个条目、5,377名参与者,每条评分均附有反应量表、提问方式和来源文献等元数据。数据库通过网页应用、Zenodo版本化发布及R和Python包开放获取,由于许多条目在多个数据集中被评分,可实现跨样本、跨量表和跨实验室的条目级比较。
一项预印本研究提出用大语言模型为心理治疗研究中的微笑补充语境,将双方微笑与谈话轮次的情感效价(正性、中性、负性)关联。在70次依恋访谈、1,294个谈话轮次中,仅访谈者的微笑随被试话语情感显著变化(d = .51,q < .001),被试自身微笑无显著差异(d = .05,q = .165);双方在正性轮次比负性轮次更常同时微笑(d = .21,p < .001)。
一项注册报告第二阶段研究比较了言语与视觉两种效应量呈现方式对教师理解研究证据的影响。研究由 Florian Kühlwein 等人开展,发表于 Learning and Instruction 第 106 卷。
一篇发表于 Biological Psychiatry 的文章指出,精准精神病学神经影像学存在选择偏差问题,作者为 Patrick G. Bissett 与 Russell A. Poldrack。文章聚焦该领域研究方法层面的偏差来源,提示基于神经影像的精准精神病学结论可能受样本选择影响。
Biological Psychiatry 第100卷第7期发布作者指南,出版日期为2026年10月1日。该指南面向向该刊投稿的作者,具体内容未在原文中展开。
一篇发表于 Clinical Psychology Review 的综述以创伤影片范式为例,探讨实验精神病理学中实验者培训的改进路径。作者 Thomas G.W. McConnell、Elisabeth J. Leehr、Matthew Garner、Deborah Talmi 与 Emily A. Holmes 从该范式的培训实践中提炼经验,并提出可供其他实验范式借鉴的启示。
一项发表于 Contemporary Educational Psychology 的研究用在线成人学习者样本验证了STEM传记式数据测量工具,将验证范围从传统课堂样本拓展至在线成人学习者群体。
一项德尔菲共识研究提出面向心理神经内分泌学的社区驱动标准化开放数据框架,作者包括 Maria Meier、Milou S.C. Sep、Thomaz F.S. Bastiaanssen 等,发表于 Psychoneuroendocrinology 第 194 卷。
针对心理治疗的元分析与随机试验,有学者提出需要重新审视并加以推进。该文发表于 Clinical Psychology Review 第129卷,作者为 Toshi A. Furukawa,出版日期为2026年11月。
开放科学中心于2026年9月8日在 MetaArXiv 发布《Registered Revisions Meta Trial Pilot Report》,记录其 Registered Revisions 政策与元试验设计的开发与试点过程。
行为科学近期大量关注浪漫伴侣、亲子等二元关系中情感、想法或行为随时间的重叠与同步。Pairmutate 是一款网页应用,通过将真实二元组与伪二元组比较来检验二元关联。该工具发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
该教程提供在 R 中开展两阶段元分析结构方程模型的分步指南,涵盖层级效应量依赖处理与调节效应分析,并以一个数据集演示完整流程。教程发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
生态瞬时评估(EMA)研究中,提示未依从与漏答造成的缺失数据十分普遍,研究者虽常考察与提示未应答相关的变量,却很少将其纳入分析。这篇发表于 Advances in Methods and Practices in Psychological Science 的实用指南,介绍了如何将辅助变量用于处理此类缺失数据。
研究者开发了一套开源可重复框架,用于同步采集慢性传感型DBS(深部脑刺激)记录与可穿戴设备行为数据,并在3名强迫症患者中完成验证,共同步6,384小时颅内神经记录与可穿戴数据。台架测试显示Medtronic Percept时钟一周内相对网络时间漂移12秒,远小于慢性神经记录10分钟的采样间隔,支持与可穿戴数据的可靠对齐。
发表在 Advances in Methods and Practices in Psychological Science 的文章指出,生成式人工智能尤其是大语言模型已嵌入研究过程,越来越多科学家用其协助撰写稿件。作者关注的是能在多大程度上识别出心理学出版物中 LLM 参与的痕迹。
推荐理由:文章讨论如何在心理学论文中识别大语言模型参与写作的痕迹,为期刊与审稿人判断稿件来源提供方法参考。
工具变量(IV)回归可用于估计无法随机分配的因果效应,是计量经济学因果推断的核心方法。这篇发表于 Advances in Methods and Practices in Psychological Science 的教程介绍了如何用非约束性实验配合 IV 回归获得无偏估计。
针对 Aungle 等人的研究,本文提出外部重复验证的必要性论证。文章发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期(2026 年 7—9 月)。
《World Psychiatry》2026年10月刊载一篇关于欧洲重性抑郁障碍平台试验的文章。该文发表于第25卷第3期,页码487-488。
针对许多科学理论预测的是多个参数之间的关系方向(如某一均值高于另一均值、若干效应呈特定顺序),而研究者常只检验方向性预期这一问题,本文介绍如何在 JASP 的 BFpack 模块中开展方向性假设检验。教程发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
马萨诸塞大学陈医学院助理教授 Andres Colubri 的 Epigame 研究用手机游戏结合蓝牙近距离感应模拟疫情传播,通过随机对照试验检验提高自愿隔离的游戏内成本是否改变人们的隔离选择。该研究已在 OSF 注册,并在数据促使团队拒绝原假设后更新了预注册。Colubri 将预注册视为研究者自建的“科学可重复性封印”,论文只是研究记录的一部分。
一项发表于 Perspectives on Psychological Science 的评论指出,估算心理学重复研究的占比十分困难。Makel 等(2012)曾检索 100 种心理学期刊,用 replicat* 在全领域数据库中检索仅返回 2%,但即便彻底的数据库检索也可能流于表面。
针对成人孤独症服务研究难以获得代表性或异质性样本、实验方法与真实世界场景脱节等问题,一项发表于 Autism 的研究构建了参与式、真实世界的孤独症成人结局纵向队列并描述其样本特征。该研究由 Academic Autism Spectrum 相关方参与推进,旨在回应成人孤独症研究中的常见方法学挑战。
一项注册报告考察了有调节的中介模型中路径调节项的设定方式如何影响统计功效、I 类错误率和参数偏差。研究聚焦研究者在选择哪些路径受调节时面临的过度设定与设定不足问题,相关结果发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
心理测量工具的效度取决于指标选择,而这一过程常被主观、非正式地处理。发表于 Current Directions in Psychological Science 的这篇文章指出,指标抽样中被忽视的环节会引发效度问题,并探讨题目选择如何帮助解决这些问题。
开放科学中心(COS)举办的"预测可重复性挑战赛"第三轮中,15支团队对46项主张提交了可重复性预测,其中41项已完成重复验证并纳入分析,仅8支团队的模型优于0.25的Brier分数基线,而第二轮全部15支团队均优于该基线。第三轮实际重复率为46%,低于前两轮的52%和55%,校准偏弱可能是表现下滑的主因。
针对带被试流失的纵向试验,研究者开发了 BayesSSD 软件包,用于贝叶斯样本量确定(SSD)。现有基于闭式公式的开源 SSD 软件难以覆盖此类设计,该工具包为此类试验的规划提供了对应方法。
针对反应时、眼跳潜伏期等时间-事件数据,传统均值比较方法存在局限,事件史分析提供了替代方案。该教程在 R 中演示了贝叶斯与频率学派两种工作流的事件史分析实现路径。
社会科学研究者正使用大语言模型生成“硅样本”,即用来替代人类被试的合成数据集。文章指出,生成这类样本涉及模型选择、抽样等多项分析选择,由此带来的分析灵活性构成威胁。该文发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
针对"单次观测到的小效应量不应被忽视、因其可长期累积"这一源自 Abelson(1985)的经典论点,一项统计说明指出效应在长期内既可能增大也可能减小。该文发表于 Perspectives on Psychological Science,尚未分配卷期。
《Educational Psychologist》刊文比较了随机对照试验与 N=me 两种方法在自我调节学习研究中的适用性。文章指出,随机对照试验擅长检验干预的平均效应,而 N=me 设计更适合刻画个体内部随时间变化的过程。作者主张根据研究问题在这两类方法之间做出选择,而非相互替代。
研究指出,将大语言模型(LLM)评分与专家评分做相关来估计评分者间信度(IRR)并不合适,因为相关法假设AI与人类评分平行,而这一条件难以成立。作者提出因子分析替代方案,把AI评分与专家评分建模为同一潜在构念的同质指标,以标准化AI载荷的平方估计AI的IRR。
犬类科学旨在理解作为独特适应人类生活的物种的狗,但研究在代表性和可推广性上存在困难。文章讨论了比较心理学中的关键问题,并提出通过大团队科学(big-team science)加以解决。
文章指出,在线研究长期依赖“认真、连贯作答即好数据”的质量启发式,但自主AI代理如今几乎能通过所有常规质量检查,这一启发式已不再可靠。作者据此提出AI介导污染的 taxonomy(分类)与风险梯度,并给出相应建议,发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
推荐理由:文章把AI代理污染在线被试数据的风险按类型和梯度梳理,并给出可操作的防范建议,对依赖线上样本的研究者有直接参考价值。
传统横断面网络中心性指标无法区分症状间的因果方向,导致干预靶点选择出现偏差。NodeIdentifyR 算法(NIRA)通过基于模拟的方法解决这一问题,相关方法发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
一项方法学论文用 Many Labs 的沉没成本效应重复数据展示,仅含实验条件单一预测变量的 OLS 回归在 15 个实验室得到中位 R² = .051,而 10 折交叉验证的中位 R² 为 -.128。
心理学家几乎从不使用稳健标准误,但经济学家的普遍做法表明他们应该使用。稳健标准误解决的是异方差问题,即部分数据点比另一些噪声更大;由于回归系数对某些数据点的噪声远比另一些敏感,忽略噪声分布位置会低估标准误。