4 至 10 岁孤独症儿童社会反应量表(SRS)的最小临床重要差值(MCID)
一项发表于 Autism 的研究为 4 至 10 岁孤独症儿童的社会反应量表(SRS)确定了最小临床重要差值(MCID),此前该指标一直未定义,限制了临床试验中治疗效应的解读。研究结果可为 SRS 在孤独症临床试验中的疗效判定提供参考阈值。
一项发表于 Autism 的研究为 4 至 10 岁孤独症儿童的社会反应量表(SRS)确定了最小临床重要差值(MCID),此前该指标一直未定义,限制了临床试验中治疗效应的解读。研究结果可为 SRS 在孤独症临床试验中的疗效判定提供参考阈值。
研究验证了社交沟通量表在中国幼儿远程医疗支持下的孤独症早期筛查中的适用性。现有远程评估工具多基于西方背景开发,文化适用性有限,该研究针对这一缺口展开。
一项研究对西班牙版BPAQ-SF在西班牙男女在押人员中的心理测量学特性进行了评估。BPAQ-SF是广泛使用的攻击性自评工具,但其在西班牙语在押人群中的心理测量学证据仍然有限。
一项针对 568 名美国大学生的研究检验了 GAD-7 的心理测量学特征,结果显示其得分呈单维因子结构,拟合指标大多优良。该量表在男女群体以及白人学生与有色人种学生之间均达到强测量不变性,总量表 alpha 系数大于 0.85。研究者认为 GAD-7 心理测量学表现良好,可作为心理咨询师免费、快速、易施测的广泛性焦虑筛查工具。
《Journal of Child Psychology and Psychiatry》第67卷第10期已于2026年10月出版。本期为期刊目录与期号信息页,未包含具体研究论文、样本数据或临床结果。
马萨诸塞大学陈医学院助理教授 Andres Colubri 的 Epigame 研究用手机游戏结合蓝牙近距离感应模拟疫情传播,通过随机对照试验检验提高自愿隔离的游戏内成本是否改变人们的隔离选择。该研究已在 OSF 注册,并在数据促使团队拒绝原假设后更新了预注册。Colubri 将预注册视为研究者自建的“科学可重复性封印”,论文只是研究记录的一部分。
针对孤独症人群、尤其是共病智力障碍者缺乏合适心理健康筛查工具的问题,研究者开发并验证了孤独症精神病理学检查表修订版(PAC-R)。该工具专为这一人群设计,相关成果已发表于 Autism。
一项发表于 Perspectives on Psychological Science 的评论指出,估算心理学重复研究的占比十分困难。Makel 等(2012)曾检索 100 种心理学期刊,用 replicat* 在全领域数据库中检索仅返回 2%,但即便彻底的数据库检索也可能流于表面。
研究开发并评估了 2 岁幼儿孤独症筛查工具简版 STAT-BF,用于解决现有筛查工具在临床中施测耗时过长的问题。该工具旨在提升幼儿孤独症早期识别的可行性,以支持及时干预。
研究基于五份幼儿全天音频记录的转录与标注,探讨测量儿童听觉输入的方法学问题。全天录音可捕捉儿童完整的听觉环境,为理解语言环境在语言学习中的作用提供数据基础。
针对成人孤独症服务研究难以获得代表性或异质性样本、实验方法与真实世界场景脱节等问题,一项发表于 Autism 的研究构建了参与式、真实世界的孤独症成人结局纵向队列并描述其样本特征。该研究由 Academic Autism Spectrum 相关方参与推进,旨在回应成人孤独症研究中的常见方法学挑战。
一项注册报告考察了有调节的中介模型中路径调节项的设定方式如何影响统计功效、I 类错误率和参数偏差。研究聚焦研究者在选择哪些路径受调节时面临的过度设定与设定不足问题,相关结果发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
随着智能手机普及,研究者开始利用手机采集的地理位置与通讯等数据来理解和预测人类行为,这类数据更客观且以非侵入方式测量。文章介绍了使用 AWARE 框架采集智能手机传感数据的方法,发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
心理测量工具的效度取决于指标选择,而这一过程常被主观、非正式地处理。发表于 Current Directions in Psychological Science 的这篇文章指出,指标抽样中被忽视的环节会引发效度问题,并探讨题目选择如何帮助解决这些问题。
开放科学中心(COS)举办的"预测可重复性挑战赛"第三轮中,15支团队对46项主张提交了可重复性预测,其中41项已完成重复验证并纳入分析,仅8支团队的模型优于0.25的Brier分数基线,而第二轮全部15支团队均优于该基线。第三轮实际重复率为46%,低于前两轮的52%和55%,校准偏弱可能是表现下滑的主因。
针对带被试流失的纵向试验,研究者开发了 BayesSSD 软件包,用于贝叶斯样本量确定(SSD)。现有基于闭式公式的开源 SSD 软件难以覆盖此类设计,该工具包为此类试验的规划提供了对应方法。
针对反应时、眼跳潜伏期等时间-事件数据,传统均值比较方法存在局限,事件史分析提供了替代方案。该教程在 R 中演示了贝叶斯与频率学派两种工作流的事件史分析实现路径。
社会科学研究者正使用大语言模型生成“硅样本”,即用来替代人类被试的合成数据集。文章指出,生成这类样本涉及模型选择、抽样等多项分析选择,由此带来的分析灵活性构成威胁。该文发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
针对"单次观测到的小效应量不应被忽视、因其可长期累积"这一源自 Abelson(1985)的经典论点,一项统计说明指出效应在长期内既可能增大也可能减小。该文发表于 Perspectives on Psychological Science,尚未分配卷期。
《Educational Psychologist》刊文比较了随机对照试验与 N=me 两种方法在自我调节学习研究中的适用性。文章指出,随机对照试验擅长检验干预的平均效应,而 N=me 设计更适合刻画个体内部随时间变化的过程。作者主张根据研究问题在这两类方法之间做出选择,而非相互替代。
研究指出,将大语言模型(LLM)评分与专家评分做相关来估计评分者间信度(IRR)并不合适,因为相关法假设AI与人类评分平行,而这一条件难以成立。作者提出因子分析替代方案,把AI评分与专家评分建模为同一潜在构念的同质指标,以标准化AI载荷的平方估计AI的IRR。
犬类科学旨在理解作为独特适应人类生活的物种的狗,但研究在代表性和可推广性上存在困难。文章讨论了比较心理学中的关键问题,并提出通过大团队科学(big-team science)加以解决。
文章指出,在线研究长期依赖“认真、连贯作答即好数据”的质量启发式,但自主AI代理如今几乎能通过所有常规质量检查,这一启发式已不再可靠。作者据此提出AI介导污染的 taxonomy(分类)与风险梯度,并给出相应建议,发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
推荐理由:文章把AI代理污染在线被试数据的风险按类型和梯度梳理,并给出可操作的防范建议,对依赖线上样本的研究者有直接参考价值。
传统横断面网络中心性指标无法区分症状间的因果方向,导致干预靶点选择出现偏差。NodeIdentifyR 算法(NIRA)通过基于模拟的方法解决这一问题,相关方法发表于 Advances in Methods and Practices in Psychological Science 第 9 卷第 3 期。
一项基于 Pathways to Desistance 研究数据的分析,采用 NEAT–SG 等值设计将 PCL–YV 与 YPI 进行连接,发现等值分数虽精度高(SEE 值紧密聚集),但与实际观测分数偏差较大、准确性差。在 PCL–YV 传统阈值 ≥30 附近的临床重要区间内,等值分数与观测分数竟呈负相关。研究提示,自评量表要成为临床显著精神病态的有效筛查工具,需满足比等值精度更严格的条件。
研究编制了青少年犯罪倾向问卷(JCPS),最终版含32个条目,验证性因素分析支持四因子三阶模型,内部一致性Cronbach's α = .91,重测信度0.86。该量表在性别上具强测量等值性、组间为弱等值性,犯罪倾向与自我控制、公正世界信念显著负相关,与道德推脱、品行问题倾向显著正相关。网络分析显示不同情境下青少年犯罪倾向的核心特征各异,为分层预防提供了干预靶点。
眼动追踪范式已被用于研究婴儿早期语言理解、词汇量个体差异及障碍人群的语言能力,但眼动与底层语言能力之间的关联假设仍存根本性疑问。研究者旨在阐明这些假设,并梳理现有证据是否支持其成立,进而为不同人群的语言发展研究提出注意事项。
一项方法学论文用 Many Labs 的沉没成本效应重复数据展示,仅含实验条件单一预测变量的 OLS 回归在 15 个实验室得到中位 R² = .051,而 10 折交叉验证的中位 R² 为 -.128。
心理学家几乎从不使用稳健标准误,但经济学家的普遍做法表明他们应该使用。稳健标准误解决的是异方差问题,即部分数据点比另一些噪声更大;由于回归系数对某些数据点的噪声远比另一些敏感,忽略噪声分布位置会低估标准误。
心理学研究者发布 R 包 statuser,已上线 CRAN,可用 install.packages('statuser') 安装。其 t.test2() 在保留 t.test() 后端的同时直接报告均值差,table2() 一次调用即可输出列联表比例与卡方检验,desc_var() 按组给出含缺失值和唯一值数量的描述统计。
一项发表于 Psychotherapy Research 第36卷第7期的研究提出 MATCH,用机器学习为来访者匹配治疗师。该研究刊于2026年9月,页码1179-1192。
一项发表于JEP:G、声称生成式AI使用与创造力呈倒U形关系的研究(Study 3),其U形被指为伪影。该研究对创意工作者做两波调查,由主管用九项量表评定创造力,二次项显著。但加入置信带后,单调关联远未被排除;改用two-lines检验后U形不显著(p = .81)。作者指出,38%的数据集中在AI使用1–2分区间,二次回归为拟合该处陡峭斜率而被迫在高分区弯出负斜率。
ResearchBox 新增 Zenodo 备份并为每个公开数据盒生成 DOI,同时放宽数据代码本要求、优化上传分组并打通 AsPredicted 账号。一项 N=30 的随机调查显示,被试在 ResearchBox 上判断数据是否可获取、下载研究材料的速度和易用性评价均优于 OSF,其中成功回答 Study 4 数据问题的中位耗时分别为 31 秒和 126 秒。
心理治疗师作为研究对象时,研究伦理面临权力、隐私与职业边界三重复杂性。文章发表于 Psychotherapy Research 第36卷第7期,聚焦心理治疗研究中治疗师转为被试所带来的伦理挑战。
统计期刊 JASA 即将发表对 p-curve 的批评,指出其存在四种不良统计特性,包括对接近 .05 或 .025 截断值的 p 值过度敏感、单调性可能被违反等。p-curve 开发者回应称,模拟显示单调性违反仅在 0.2%–2.8% 的模拟中出现,加入 p = .04988 的极端值后检验力下降 0.1%–5%,且 p-curve 应用已内置排除极端值的稳健性检验。
一项发表于 QJE 的 LinkedIn 审计研究通过约 400 个虚构年轻男性账号发送了 3 万多条连接请求,发现黑人照片的连接接受率更低,但接受后获得职业建议的比例相当。Data Colada 指出该研究虽在随机化和刺激配对设计上颇为精巧,但 197 对 AI 生成照片在吸引力上高度相似,刺激材料多样性不足,可能限制结论的推广。
Data Colada 作者 Uri Simonsohn 与 Andres Montealegre、Ioannis Evangelidis 在即将发表于 JPSP 的论文《Stimulus Sampling Reimagined》中提出,刺激选择应着眼于内部效度而非外部效度,并主张用刺激图分析各刺激的结果差异。
针对 Oprea 对“复杂性”批评的回应,本文指出其数据并不支持中位数“不稳定”和“不具代表性”两点主张。在 150 次自助抽样中,多数镜像前景的中位数标准误为 0,取值完全一致;而被质疑的聚合中位数 CDF 排除了 G50 和 L50 两个前景,且聚合中位数并非作者实际分析的对象。按均值与中位数附近观测占比比较,中位数代表性明显更高,且中位数准确复现了彩票与镜像的差异及前景理论预测模式。
一项研究在澳大利亚男性严重暴力犯罪者样本中检验了 LSI-R:SV、LS/RNR 与 VRS 三种风险评估工具的效度。该研究发表于 Psychology, Crime & Law 第 32 卷第 9 期。
Data Colada 发文指出,Hainmueller、Mummolo 和 Xu(HMX)2019 年提出的分箱估计量在观察数据中常存在偏差,双方分歧的核心在于分析交互作用时是否应遵循 ceteris paribus。作者以博士招生为例说明,当交互项中的变量相关时,非线性会污染交互效应估计,而 HMX 所选估计目标并未反映研究者真正想问的问题。