QJE 警务认知干预田野实验:约 40 个结果变量下,武力使用与自由裁量逮捕的减少并不真正显著
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
Data Colada指出,2019年发表于Political Analysis、被引超1000次的交互效应"分箱估计量"不应再用于观察数据。当焦点预测变量x与调节变量z相关、且x或z对y存在非线性影响时,该估计量与线性回归的交互项d同样有偏,会产生假阳性交互和符号错误的边际效应。作者建议改用GAM。
行为科学与临床试验中常用的组间设计无法直接判断单个被试是否受处理影响,KS 检验的 D+ 与 D- 统计量可作为这一比例的上下界。以一项 $50 礼品券与 50:50 彩票的估值实验为例,D+ 约为 55%、D- 约为 18%,即至少 55% 的被试对礼品券估值更高、至少 18% 相反。
一项对2022年 Psych Science、JEP:G、JPSP 和 JCR 四本期刊论文的统计发现,约43%的论文至少有一项研究做了预注册,且该比例在可预注册研究中更高。约半数指向 AsPredicted 的链接为仅供同行评审的匿名版本,约17%的 OSF 链接指向匿名项目页。作者建议期刊要求作者说明未预注册理由、核查链接,并采用单一仓库链接。
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 的一篇文章指出,当中介变量 M 与结果变量 Y 在实验之外存在相关时,中介分析会失效。作者 Uri Simonsohn 解释,随机分配只保证 X 对 Y 的估计无偏,一旦在回归中加入 M,b 和 c' 都会产生遗漏变量偏倚,c' 被低估,从而高估中介效应,甚至在没有中介时也看到中介。
一项针对 2335 份已发表论文附带 R 脚本的自动重跑发现,仅 44% 能无错运行,21% 的失败源于包无法加载。为此发布的 groundhog 2.0 新增支持 GitHub 和 GitLab 包,预计 2022 年 5 月上线 CRAN,此前可用 GitHub 上的 v1.9.9.9999 版本。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
Data Colada 作者 Uri Simonsohn 推出 R 包 groundhog,用 groundhog.library() 替代 library(),只需额外输入一个日期,即可加载该日期在 CRAN 上的包版本及其全部依赖,使同一段代码在不同电脑上长期得到相同结果。
ResearchBox 是一个便于研究者共享数据、代码、材料和预注册的新平台,设计思路类似 AsPredicted,但比 OSF 更聚焦于向读者共享研究支撑材料,不提供项目分叉、多作者子组件、wiki 协作或 AWS 集成等功能。
Uri Simonsohn 针对即将刊于 AER 的论文《Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics》提出质疑。
Data Colada 的 Data Replicada 项目尝试重复验证 Journal of Consumer Research 一篇关于资源稀缺与价格质量判断的研究,重复实验中稀缺组的价格质量相关低于对照组,但效应量 d = .15,远小于原研究的 d = .42。