JASA 将刊批评 p-curve 的四种统计特性,原作者回应称实践中仍稳健
统计期刊 JASA 即将发表对 p-curve 的批评,指出其存在四种不良统计特性,包括对接近 .05 或 .025 截断值的 p 值过度敏感、单调性可能被违反等。p-curve 开发者回应称,模拟显示单调性违反仅在 0.2%–2.8% 的模拟中出现,加入 p = .04988 的极端值后检验力下降 0.1%–5%,且 p-curve 应用已内置排除极端值的稳健性检验。
统计期刊 JASA 即将发表对 p-curve 的批评,指出其存在四种不良统计特性,包括对接近 .05 或 .025 截断值的 p 值过度敏感、单调性可能被违反等。p-curve 开发者回应称,模拟显示单调性违反仅在 0.2%–2.8% 的模拟中出现,加入 p = .04988 的极端值后检验力下降 0.1%–5%,且 p-curve 应用已内置排除极端值的稳健性检验。
Data Colada 作者 Joe Simmons 分析 Nature Human Behaviour 2023 年一项关于科学相关错误信息纠正效果的元分析,该文摘要称纠错尝试平均而言不成功(d = 0.11,p = .142)。
针对 Oprea 对“复杂性”批评的回应,本文指出其数据并不支持中位数“不稳定”和“不具代表性”两点主张。在 150 次自助抽样中,多数镜像前景的中位数标准误为 0,取值完全一致;而被质疑的聚合中位数 CDF 排除了 G50 和 L50 两个前景,且聚合中位数并非作者实际分析的对象。按均值与中位数附近观测占比比较,中位数代表性明显更高,且中位数准确复现了彩票与镜像的差异及前景理论预测模式。
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
Data Colada 发文指出,Hainmueller、Mummolo 和 Xu(HMX)2019 年提出的分箱估计量在观察数据中常存在偏差,双方分歧的核心在于分析交互作用时是否应遵循 ceteris paribus。作者以博士招生为例说明,当交互项中的变量相关时,非线性会污染交互效应估计,而 HMX 所选估计目标并未反映研究者真正想问的问题。
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
Data Colada 指出,一篇即将发表于 Psych Methods 的论文让编码者评估 300 份预注册,结论是心理学预注册(尤其依赖 AsPredicted 模板者)信息不足,但未发现预注册随时间变得更有信息量、也未发现发表研究偏离预注册的显著效应。
因指出 Francesca Gino 合著的四项研究存在数据造假,Data Colada 三位作者遭其提起 2500 万美元诽谤诉讼,并已向马萨诸塞州联邦法院申请驳回。4 月 26 日听证会上,双方就涉案陈述是否属于“观点”及 Gino 是否属公众人物展开辩论,法官尚未裁定是否驳回。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 作者在系列文章的开篇提出,行为科学中许多元分析是无效的,问题集中在两点:一是缺乏质量把关,把有效与无效研究一起平均;二是把不可比的结果合并,例如不同操纵强度或不同结局的研究。
Data Colada 对一篇发表于 Nature 的犯罪现场实验提出质疑:该研究将 55 个公共住房楼群随机分配至实验组与对照组,报告干预使前三个月犯罪率下降 6.9%(p = .036),但分析偏离了预注册,且关键操纵存在仅见于原始材料的混淆变量。作者指出,透明性只能证明研究可被评估,不能证明结论有效。
一封致《Autism》编辑的信建议,在与孤独症成人开展研究时使用 Autism Quality of Life 量表。该量表专为配合 WHOQoL-BREF 使用而开发。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
一项分析462场经济学研讨会提问的NBER论文称女性演讲者被提问更多且问题更具居高临下或敌意,但Data Colada的解读认为该结论证据不足。数据显示女性演讲者获得约多3个提问,差异主要来自男性更常被提问过少;敌意与居高临下问题的效应量小且统计证据薄弱(p=.1和p=.02),其他指标方向不一致。
Uri Simonsohn 针对即将刊于 AER 的论文《Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics》提出质疑。