外部重复验证的理由:对 Aungle 等人的回应
针对 Aungle 等人的研究,本文提出外部重复验证的必要性论证。文章发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期(2026 年 7—9 月)。
针对 Aungle 等人的研究,本文提出外部重复验证的必要性论证。文章发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期(2026 年 7—9 月)。
研究在289名因2017年普埃布拉7.1级地震流离失所超过1个月的墨西哥社区地震幸存者中,检验了墨西哥方言西班牙语版繁荣量表(FS)的信度、效度与测量不变性。
针对Németh等(2026)在Cognitive Science上对一项3–9岁儿童视觉统计学习(visual SL)实验文章的评论,原作者回应了三点争议:对其研究结果的解读、纵向与横断面设计对识别视觉SL年龄动态的重要性,以及将SL视为并非完全内隐过程的观点。作者通过讨论实验任务与刺激序列对学习过程的影响,以及个体对实验的预期等心理因素的参与,澄清了SL并非完全内隐的立场。
精神医学研究已从单中心、小样本转向多中心、大样本、多变量,覆盖社区与登记调查、队列与生物样本库、电子健康记录、数字表型、脑影像、基因组学及随机对照试验。大样本并不保证更精确的估计,仍需关注数据质量与方法严谨性;大数据揭示了精神障碍机制的复杂性、异质性与变异性,也凸显了大小规模研究相互印证的必要。
一项基于美国退伍军人人群样本的研究提示,社区社会经济劣势可能通过慢性压力、社会隔离和医疗可及性有限等途径影响心理健康,这些途径在高、中、低收入国家普遍存在。将ADI等社区层面指标纳入流行病学研究和临床风险评估,有助于推动公平且结合情境的医疗模式。由于社区劣势至少部分可改变,在可负担住房、社区安全、循证医疗和社会支持系统上的投入有望缩小心理健康差距。
孤独症与非孤独症青少年被配对成孤独症—孤独症、孤独症—非孤独症、非孤独症—非孤独症三种组合,完成录像的“相互认识”互动,头部位置经 OpenPose 逐帧提取,并用交叉小波相干量化头部运动同步性。互动组的同步性显著高于时间打乱组,但不同配对类型之间无差异;在各配对类型中,头部运动同步性均负向预测青少年自评的互动愉悦感、正向预测不适感。
一项认知科学研究让被试在威斯康星卡片分类测验(WCST)任务中适应不同规则更新速度的环境,结果发现被试最初依据近期经历的波动水平和反馈来选择任务规则更新策略(实验1),经过4天大量训练后(实验2),则转而依据习得的环境知识来更新规则。研究还刻画了被试在学习过程中如何逐步微调其规则更新策略,提示多日训练对形成环境知识、调控认知控制具有重要作用。
Sheinenson、Kleiman 和 Siegelman 在 Cognitive Science 的研究发现,视觉配对的统计学习带来的目标检测反应时促进,完全由前一个形状的预测价值驱动,而非目标本身的可预测性。本文指出一项分歧结果:在概念设计相似的语音统计学习范式中,促进效应完全取决于前一个音节是否具体预测了目标。统计环境的相对稳定性和统计学习领域可能是决定目标检测是否调用预测的关键因素。
一项发表于 Communications Psychology 的研究用强化学习训练循环神经网络,使其输出在多种速度下与节拍器同步。最有效的强化方案还重现了人类节拍同步行为的关键特征。
一项无句法违例的双任务实验发现,语言与音乐之间存在双向但不平衡的跨域交互,语言对音乐的影响大于反向影响,且主要源于句法结构复杂度而非句法工作记忆需求。当句法关键词语与关键和弦在时间上重合时,跨域交互最为显著。结果支持语言与音乐共享资源的理论模型。
该文章提出“在线可信度评估中的先验知识框架”,将先验知识分为内容知识、证据知识、来源知识、在线体裁知识与文化知识五类相互关联的类型,用以扩展既有可信度评估模型。框架描述了这五类知识如何促进可信度评估策略的有效使用,并为未来研究、测评与教学提供理论、方法与教学启示。
针对许多科学理论预测的是多个参数之间的关系方向(如某一均值高于另一均值、若干效应呈特定顺序),而研究者常只检验方向性预期这一问题,本文介绍如何在 JASP 的 BFpack 模块中开展方向性假设检验。教程发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
一项先导研究未发现运动学习后突触密度与灰质体积出现显著变化。该研究由KU Leuven等机构开展,相关成果发表于npj Science of Learning。
一项研究比较了 504 份 LLM 生成与 504 份临床医生撰写的会谈摘要,这些摘要来自 36 次会谈的 108 个五分钟片段,由不知来源的评审者按事实一致性、核心意义保留和临床价值评分。
推荐理由:研究用盲评直接比较了 LLM 与临床医生撰写的会谈摘要,为 AI 辅助记录的工作流提供了分维度的证据。
一项对MindApps.org数据库中865款心理健康应用的五年纵向生存分析发现,464款(53.6%)在2,142天的研究期内被下架。不同临床目标的应用生存期存在差异,戒烟类应用下架风险最高,睡眠类应用生存期最长;仅支持安卓而不兼容iOS是应用被下架最突出的特征,其下架风险是其他应用的2.32倍(Cox回归C-index=0.77,随机森林AUC=0.82)。
一项针对加拿大安大略省340名囚犯的研究用巧合分析(CNA)识别与释放准备度低或高相关的最小充分或必要条件。低准备度存在两条等效路径,均需暴力犯罪史,并分别合并终身精神科住院史或当前监所行为问题;高准备度则与无暴力犯罪史、报告家庭功能失调等相关。研究提示暴力史可能是结构化囚犯释放准备度感知的门槛因素,但低准备度模型拟合度有限,需谨慎解读。
基于反事实思维功能理论,研究者开发了服务型领导反事实思维干预(CTISL),让领导者反思过去与下属互动中如何更好地满足其需求。两项前后测随机实验支持了该干预的效果:研究1在Prolific样本中检验了干预对领导者服务型领导意向的作用,研究2在多家组织的现场实验中检验了干预对领导者服务型领导及下属蓬勃发展和服务行为的影响。
针对 Sajons 与 Antonakis 即将发表的质疑,本文指出正念有助于提升职场幸福感、健康的社会互动与工作绩效,相关跨学科文献在严谨性和广度上均值得信赖。作者主张将正念纳入组织认知模型,厘清其在职场中的前因、调节因素与边界条件,以弥合乐观与怀疑两种立场之间的分歧,并认为正念有益、无害,值得持续的学术与组织投入。
一项发表于 Journal of Organizational Behavior 的 Point 文章指出,职场正念的实践可能跑在了稳健科学证据前面,管理与应用心理学研究面临六项系统设计与估计挑战:调查研究无法识别因果效应、中介机制检验程序不足、多数研究依赖自评而非客观结果、干预研究多采用自我选择的员工样本且反事实对照薄弱、综述所依据的原始研究存在明显方法学局限。
两项实验(N = 287、N = 177)和一项多来源多阶段现场研究(N = 364 对领导—成员配对)发现,员工感知到领导工作相关保密会通过心理契约违背减少其指向领导的自主行为(组织公民行为与建言),这一效应在信任倾向低的员工中尤为明显。
一项研究对西班牙版BPAQ-SF在西班牙男女在押人员中的心理测量学特性进行了评估。BPAQ-SF是广泛使用的攻击性自评工具,但其在西班牙语在押人群中的心理测量学证据仍然有限。
一项针对420名成年初显期个体的潜在类别分析识别出三类不良童年经历(ACEs)模式:低暴露、情感逆境和高暴露。三类在生活质量、生活满意度、自我韧性和生命意义感上差异显著,高暴露组结局最差;但成年初显期发展特征在各组间无显著差异。
一项并行嵌入式混合方法研究以 50 名咨询学生为对象,考察 ChatGPT 对咨询技能自我效能的支持作用。前后测双向混合设计方差分析显示交互效应显著,在应对挑战性来访者(尤其是建立关系)的效能感上效应量较大(partial η² = 0.185)。对学生反思的主题分析归纳出使用 ChatGPT-4o 练习咨询技能的 5 项积极体验与 6 项主要挑战。
一项混合方法研究访谈了大学心理咨询培训中心 17 名成人来访者,他们对 OQ-45 结局评估的反应分为临床获益与准确性威胁两类,并体现为对 OQ-45 的喜爱度与感知准确性。交叉混合分析显示,OQ-45 评估结果、临床获益与对 OQ-45 的喜爱度之间呈强相关。研究者据此提出概念模型,认为来访者对 OQ-45 的态度取决于评估结果与其在咨询中所获收益的契合程度。
一项针对 568 名美国大学生的研究检验了 GAD-7 的心理测量学特征,结果显示其得分呈单维因子结构,拟合指标大多优良。该量表在男女群体以及白人学生与有色人种学生之间均达到强测量不变性,总量表 alpha 系数大于 0.85。研究者认为 GAD-7 心理测量学表现良好,可作为心理咨询师免费、快速、易施测的广泛性焦虑筛查工具。
一项系统综述与元分析汇总了89项随机对照试验(N = 10,219),发现多数参与者在各时间点均未达成身体活动目标,未达成率在57.9%至77.0%之间,且达成率随时间下降。
推荐理由:汇总89项随机对照试验,量化了身体活动目标未达成率随时间上升的趋势,并指出目标由他人设定时达成率更低。
2010年由 Henrich 等人提出的 WEIRD 框架(西方、受教育、工业化、富裕、民主)曾引发对心理学过度依赖西方样本的广泛关注。发表于 Perspectives on Psychological Science 的这篇文章质疑,文化心理学自身是否复制了它所批判的问题。
心理科学领域受训者中精神病理学亲身经历并不少见,但持续存在的污名使从业者往往不敢披露自身经历。发表于 Perspectives on Psychological Science 的一篇框架性文章提出,应以基于优势与文化谦逊的视角指导这类受训者。
针对意愿性人格改变干预,研究者提出十点担忧并给出应对思路。人格特质已被发现可预测幸福感、健康、关系质量与工作成功等多个重要生活结果,而许多人希望以某种方式改变自己的人格。
数字数据社会的转型给心理学研究带来重要却常被低估的影响,部分源于学科内对数据伦理的讨论过于狭窄。文章提出一种物质-关系的数据本体论,以应对数据驱动时代心理学研究面临的数据伦理挑战。
两项研究提出并验证了工作场所不公正中的“责任转移”模型:同事的不公正行为会通过同事责任归因与主管责任归因的序列中介,进而预测受害者对主管的不公正感知。研究2重复验证了该效应,并发现当受害者感知到中间人授权(PID)且自身相对主管的地位低于冒犯同事时,责任从直接冒犯者向主管转移的效应更强。结果表明,责任判断发生在充满权力关系的网络中,而非孤立的二元关系里。
一项基于FSPPD两波、间隔两年的纵向研究(588名青少年及其父母、教师)采用多宇宙分析发现,相比反向效应,证据更支持过度保护教养预测青少年问题行为随时间增加。研究提示,在两年间隔内,过度保护教养对青少年问题行为主要呈方向性影响。
一项基于挪威母子队列63,032名儿童的结构方程模型研究发现,儿童教育相关多基因评分(PGS edu)越高,师生冲突越低(β = −0.08)、教师积极回应越多(β = 0.07),但与师生亲密感无关。师生冲突和教师积极回应显著部分中介了PGS edu与6–8岁阅读和数学表现之间的关联,师生亲密感则无中介作用。
Goueta 等(2025)用随机截距交叉滞后面板模型(RI-CLPM)发现,ADHD 症状与青少年风险行为的关联主要由稳定的个体间差异驱动,而非个体内波动。
一项发表在 npj Science of Learning 的研究利用 da Vinci Research Kit 的穿环轨道任务,考察任务复杂度和人机运动缩放比例如何影响远程操作学习。被试完成训练、保持和迁移阶段,同时一个线性二次高斯(LQG)控制器执行相同任务。人类与模型在练习改善和跨复杂度泛化上表现出定性相似的模式,提示简单控制理论模型可捕捉人类远程操作学习的特征。
马萨诸塞大学陈医学院助理教授 Andres Colubri 的 Epigame 研究用手机游戏结合蓝牙近距离感应模拟疫情传播,通过随机对照试验检验提高自愿隔离的游戏内成本是否改变人们的隔离选择。该研究已在 OSF 注册,并在数据促使团队拒绝原假设后更新了预注册。Colubri 将预注册视为研究者自建的“科学可重复性封印”,论文只是研究记录的一部分。
早期职业研究者因负责数据收集与分析,常最先承受零结果或不可重复结果带来的情绪冲击。Perspectives on Psychological Science 刊文梳理了零结果的成因,包括低统计功效等因素,并指出这类结果未必源于研究者个人失误。
JAMA Psychiatry 更正了《男性产后抑郁的团体育儿干预:整群随机临床试验》一文表2中的标注错误,Rosenberg 自尊量表(RSS)一行原标为 median(IQR),已改为 mean(SD)。该文于2024年10月2日在线首发,刊于2025年1月期,更正已在线发布。
针对Nayak等人的质疑,作者回应称其预注册H2假设为开放标签与盲法传统抗抑郁药试验的差异将超过HAMD-17上≥3分的最小临床重要差值,结果发现差异真实存在但仅为边缘性(盲法vs开放标签β=0.8,95%可信区间−1.1至2.6,贝叶斯模型估计差异大于0的后验概率为85.4%)。
针对 Williams 等人在 JAMA Psychiatry 发表的迷幻药物疗法(PT)与传统抗抑郁药(TADs)疗效比较一文,有学者致信编辑提出质疑:该比较建立在有缺陷的假设之上,忽视了双盲随机临床试验与开放标签试验(OLTs)之间的方法学差异。来信指出,既往研究发现试验前预期并不预测 PT 的应答,且所引 TAD OLTs 存在排除无应答者、停药仅 1 周等系统性偏倚,可能夸大效应量。