元分析中的均值为何常常无意义:以不诚实行为元分析为例
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 作者在系列文章的开篇提出,行为科学中许多元分析是无效的,问题集中在两点:一是缺乏质量把关,把有效与无效研究一起平均;二是把不可比的结果合并,例如不同操纵强度或不同结局的研究。
Data Colada 的一篇文章指出,当中介变量 M 与结果变量 Y 在实验之外存在相关时,中介分析会失效。作者 Uri Simonsohn 解释,随机分配只保证 X 对 Y 的估计无偏,一旦在回归中加入 M,b 和 c' 都会产生遗漏变量偏倚,c' 被低估,从而高估中介效应,甚至在没有中介时也看到中介。
Data Colada 对一篇发表于 Nature 的犯罪现场实验提出质疑:该研究将 55 个公共住房楼群随机分配至实验组与对照组,报告干预使前三个月犯罪率下降 6.9%(p = .036),但分析偏离了预注册,且关键操纵存在仅见于原始材料的混淆变量。作者指出,透明性只能证明研究可被评估,不能证明结论有效。
一项针对 2335 份已发表论文附带 R 脚本的自动重跑发现,仅 44% 能无错运行,21% 的失败源于包无法加载。为此发布的 groundhog 2.0 新增支持 GitHub 和 GitLab 包,预计 2022 年 5 月上线 CRAN,此前可用 GitHub 上的 v1.9.9.9999 版本。
一封致《Autism》编辑的信建议,在与孤独症成人开展研究时使用 Autism Quality of Life 量表。该量表专为配合 WHOQoL-BREF 使用而开发。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
Data Colada 与一组匿名研究者分析 Kristal 等人 2020 年公开的原始数据后指出,2012 年发表于 PNAS 的一项现场实验(N = 13,488,由美国东南部一家汽车保险公司实施)存在数据伪造证据。
推荐理由:通过字体、取整和分布异常还原数据造假手法,并说明公开数据为何是发现问题的关键。
Data Colada 对《Journal of Consumer Research》论文“Goal Conflict Encourages Work and Discourages Leisure”中的研究 1a(N = 210)进行了两次重复,样本量约为原研究的 5 倍(重复 1 为 1,008 人,重复 2 为 1,127 人)。
一项分析462场经济学研讨会提问的NBER论文称女性演讲者被提问更多且问题更具居高临下或敌意,但Data Colada的解读认为该结论证据不足。数据显示女性演讲者获得约多3个提问,差异主要来自男性更常被提问过少;敌意与居高临下问题的效应量小且统计证据薄弱(p=.1和p=.02),其他指标方向不一致。
Data Colada 作者 Uri Simonsohn 推出 R 包 groundhog,用 groundhog.library() 替代 library(),只需额外输入一个日期,即可加载该日期在 CRAN 上的包版本及其全部依赖,使同一段代码在不同电脑上长期得到相同结果。
Data Replicada 第9期复制了 Journal of Marketing Research 一篇关于减重产品广告的研究,原研究(N = 213)发现渐进式广告比"前后对比"广告更可信。
ResearchBox 是一个便于研究者共享数据、代码、材料和预注册的新平台,设计思路类似 AsPredicted,但比 OSF 更聚焦于向读者共享研究支撑材料,不提供项目分叉、多作者子组件、wiki 协作或 AWS 集成等功能。
Data Replicada 对一篇 JMR 左位数偏差论文的研究1(N = 145)开展两项预注册重复验证,重复1(N = 1,099)与重复2(N = 1,555)均仅发现边缘显著的交互,即价格同屏呈现时左位数偏差方向性更大,但证据远弱于原研究。原研究仅有9.3%和7.8%的检验力检出两次重复结果,需3,000至4,500名被试才有80%把握检出。
Uri Simonsohn 针对即将刊于 AER 的论文《Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics》提出质疑。
Data Colada的重复验证未能复现Journal of Consumer Research一项研究的结果:展示五瓶滴露(vs.一瓶)并未显著提高被试对产品效果的评分。三次预注册重复验证样本量至少为原研究(N=87)的6.5倍,最支持原假设的第三次重复中效应量仅为d=.10,远小于原研究的d=.43。
Data Colada 的 Data Replicada 项目尝试重复验证 Journal of Consumer Research 一篇关于资源稀缺与价格质量判断的研究,重复实验中稀缺组的价格质量相关低于对照组,但效应量 d = .15,远小于原研究的 d = .42。
《Personality and Social Psychology Review》期刊编辑就 Benjamin、Kepes 与 Bushman(2017)关于武器对攻击性思维、愤怒情绪、敌意评价及攻击行为影响的研究发表关注声明。该声明针对这篇已在线发表的文章,具体关注内容未在声明中详述。
一项研究考察了矫正干预中风险水平与治疗剂量的交互作用。风险原则主张,有效干预应按犯罪者风险调整治疗强度,高风险者应获得比低风险者更密集的服务。