Data Colada 质疑 AER 论文:75% 被试未通过理解题,前景理论结论或源于混淆
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
一项基于 608 起诈骗受害事件的研究发现,仅 11.8% 的受害者会向警方报案。诈骗严重程度与报案率持续相关,损失金额更大、对生活影响更严重的案件更常被报案;同时,来自城市化地区的居民报案率显著更低。研究还考察了自罪感、线上线下情境、与施害者关系及大五人格、自控、乐观、孤独感等受害者特征。
一项范围综述纳入95项定量研究,梳理警察接触与犯罪行为关联的理论路径,发现研究主要基于程序公正理论、紧张理论、标签理论和威慑理论四大框架,彼此间缺乏整合与竞争。关键概念测量差异大,且能充分处理内部效度威胁的研究较少,难以判断各理论证据强度。作者呼吁提出可证伪假设、统一测量并重视因果推断设计。
一项针对 420 名因严重暴力犯罪被判入狱的澳大利亚男性的研究,检验了 LSI-R:SV、LS/RNR 和 VRS 的预测效度、区分效度与增量效度。LSI-R:SV 和 LS/RNR 得分可预测所有再犯结果(任何再犯、非性暴力再犯和非暴力再犯),VRS 仅预测任何再犯和非性暴力再犯;跨时间分析时三种工具的总体区分效度均提升。
Data Colada 发文指出,Hainmueller、Mummolo 和 Xu(HMX)2019 年提出的分箱估计量在观察数据中常存在偏差,双方分歧的核心在于分析交互作用时是否应遵循 ceteris paribus。作者以博士招生为例说明,当交互项中的变量相关时,非线性会污染交互效应估计,而 HMX 所选估计目标并未反映研究者真正想问的问题。
一项系统综述检验了被告情绪表达是否影响定罪与量刑,发现相比不表达情绪,被告表达情绪可能对定罪和量刑结果更有利,但这一结论并不适用于所有情绪类型。该效应受多种边界条件(调节变量)影响,且几乎只在学生样本中得到验证。综述建议对法律从业者开展情绪智力培训。
一项在线实验调查考察了15个亚太与欧洲国家377名警务与情报从业者对审讯中程序正义原则的认可程度。调查中的3(强制:强制、非强制、混合)×2(犯罪危害:高、低)被试间实验显示,这些经验丰富的从业者强烈偏好非强制审讯策略,且对程序的满意度同样源于认为程序尊重被拘留者并能有效获取有用信息,而"被拘留者得到应有对待"的驱动作用较弱。
一项发表于 Autism 的研究考察了孤独症、非孤独症及混合神经类型配对在互动中的社会运动同步与互动融洽感。在非孤独症人群中,互动时的社会运动同步与更高的人际融洽感有关,而此前研究提示孤独症个体的表现有所不同。
一项研究以95名11–14岁儿童为被试,用GSS1、GSS2及儿童应对策略量表考察应对策略对即时受暗示性和抵抗行为反应(RBR)的影响。任务导向和回避型应对策略与更低的受暗示性得分有关,并促进更多抵抗行为反应;问题解决策略对抵抗行为反应尤为显著。年龄越大、使用越主动的应对策略,受暗示性水平趋于下降。
一项针对美国法院强制物质使用治疗人群的研究发现,边缘型人格障碍(BPD)症状越重,治疗依从自我效能越低。40名被试中52.6%存在BPD症状升高,BPD症状总分与治疗自我效能呈负相关(r = −0.37,p = .04),分层回归显示BPD症状升高可预测更差的治疗依从自我效能(b = −0.16,95% CI −1.33至−0.01)。
716名具备陪审员资格的成年人观看一段儿童性侵指控访谈记录后发现,儿童仅1次运用"我不理解"(IDU)或"我不知道"(IDK)规则时,被认为比6次运用时更可信、更不可能故意说谎,也更可能理解自己陈述的用途。儿童年龄(6岁与10岁)和规则类型的影响相对有限。
一项研究比较了法医精神科高/中安全级别治疗起始阶段的三组患者:40名出院两年内再犯者、337名未再犯者和59名长期住院者,发现三组在 HKT-R 的12个历史因素中有11个存在得分差异。
一项针对93名在西班牙多个中心接受司法治疗性监禁的青少年研究发现,VR辅助CBT和传统CBT都能降低两类青少年罪犯的再犯风险,包括实施儿童对父母暴力(CPV)者和其他类型犯罪者。VR辅助CBT在降低犯罪倾向方面效果优于传统CBT,在实施CPV的未成年人中尤为明显。作者认为VR可作为传统CBT的补充手段。
两项实验测试了外貌变化提示(ACI)对目击者辨认的影响,结果发现ACI并未提高辨认准确率,在某些指标上反而降低了准确率。此前研究仅考察过胡茬增加或目标年龄变化等有限类型,本研究将变化扩展到可能随时间消失的瘀伤和更持久的纹身。
一项发表于 Psychology, Crime & Law 的研究运用社会网络分析(SNA),通过七名真实贩毒组织成员的半结构化访谈、调查警官访谈和判决证词进行三角验证,考察该组织是否已演变为更灵活的架构。结果显示,该组织由相互依存的子群体构成,以核心—边缘逻辑共存互联,中介成员的联系最大化了资源交换(效率需求),却损害了安全,成为执法可切入的薄弱环节。
研究开发了一套面向庇护官员的75小时混合式法律心理学培训,并用带等待名单对照组的准实验前后测设计评估效果。培训在记忆与访谈等主题的知识及提问能力测试上产生较大即时效应(d = 1.67),5个月随访后提升仍然保持。作者指出,后续研究需要考察这些知识能否迁移到实际的庇护裁决中。
推荐理由:针对庇护官员的法律心理学培训显示,知识测试成绩在培训后大幅提升并维持五个月,为司法决策培训提供了可参考方案。
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
Data Colada指出,2019年发表于Political Analysis、被引超1000次的交互效应"分箱估计量"不应再用于观察数据。当焦点预测变量x与调节变量z相关、且x或z对y存在非线性影响时,该估计量与线性回归的交互项d同样有偏,会产生假阳性交互和符号错误的边际效应。作者建议改用GAM。
行为科学与临床试验中常用的组间设计无法直接判断单个被试是否受处理影响,KS 检验的 D+ 与 D- 统计量可作为这一比例的上下界。以一项 $50 礼品券与 50:50 彩票的估值实验为例,D+ 约为 55%、D- 约为 18%,即至少 55% 的被试对礼品券估值更高、至少 18% 相反。
Data Colada 指出,一篇即将发表于 Psych Methods 的论文让编码者评估 300 份预注册,结论是心理学预注册(尤其依赖 AsPredicted 模板者)信息不足,但未发现预注册随时间变得更有信息量、也未发现发表研究偏离预注册的显著效应。
Data Colada作者Joe Simmons称,因Francesca Gino起诉其诽谤,哈佛一份1288页调查报告被公开,其中披露了Gino、Kouchaki和Casciaro(2020)研究3A的原始数据集。
Data Colada 公开了原定 2019 年发布、因收到疑似死亡威胁而搁置的调查,指出 Ping Dong 与 Chen-Bo Zhong 2017 年发表于 Psychological Science 的论文存在数据异常,该论文已于 2018 年撤稿。
推荐理由:作者公开了当年因威胁而搁置的数据造假调查,用五条时间戳证据说明数据可能是在采集阶段被伪造的。
因指出 Francesca Gino 合著的四项研究存在数据造假,Data Colada 三位作者遭其提起 2500 万美元诽谤诉讼,并已向马萨诸塞州联邦法院申请驳回。4 月 26 日听证会上,双方就涉案陈述是否属于“观点”及 Gino 是否属公众人物展开辩论,法官尚未裁定是否驳回。
一项对2022年 Psych Science、JEP:G、JPSP 和 JCR 四本期刊论文的统计发现,约43%的论文至少有一项研究做了预注册,且该比例在可预注册研究中更高。约半数指向 AsPredicted 的链接为仅供同行评审的匿名版本,约17%的 OSF 链接指向匿名项目页。作者建议期刊要求作者说明未预注册理由、核查链接,并采用单一仓库链接。
Data Colada 发文梳理 Francesca Gino 诉讼中作为证据的哈佛撤稿请求(Exhibits 3、4、5),其中引用了哈佛聘请的独立取证公司的报告。
推荐理由:哈佛提交的撤稿请求首次公开了独立取证公司对四篇论文数据比对的细节,可了解学术不端调查如何取证。
Data Colada 作者此前报告四篇论文存在数据篡改证据,这些论文随后被撤稿,几周前他们因此被起诉。为应对诉讼发起的筹款已获得超过2600名捐赠者支持,涵盖社会科学、生命科学、健康科学、计算机科学、统计学等领域,包括诺贝尔奖得主、各级教职人员和学生。作者已聘请法律团队,其三个雇主 Penn、Berkeley 和 ESADE 表示将至少支持诉讼初期阶段,并称案件可能持续数月甚至数年。
Data Colada 系列第四篇指出,Gino、Kouchaki 与 Casciaro 2020 年发表于 Journal of Personality and Social Psychology 的研究中,Study 3a(N = 599 名 MTurk 被试)的“道德不洁”评分可能被篡改。
推荐理由:作者用被试写下的词语与评分不匹配,指出论文数据可能被篡改,为识别数据造假提供了一种可迁移的核查思路。
Data Colada 系列第三篇指出,Gino 与 Wiltermuth 2014 年发表于 Psychological Science 的研究中,实验 4 的数据几乎完全按“是否作弊”和“报纸用途数量”两列排序,其中 13 个作弊者观测值顺序异常,疑似排序后被手动修改。
推荐理由:通过数据排序异常与模拟检验,展示了识别数据篡改的一种可迁移取证思路。
Data Colada 系列文章第二部分称,Francesca Gino 等人 2015 年发表于 Psychological Science 的研究中,Study 4 的数据集出现异常:491 名哈佛学生被问及“Year in School”时,有 20 人回答“Harvard”,且这些记录集中在数据文件第 450 至 484 行之间。
推荐理由:文章用一份数据集中的异常作答记录,展示了识别数据篡改痕迹的一种可迁移核查思路。
Data Colada 发布四篇系列文章的第一篇,披露哈佛商学院教授 Francesca Gino 合著的四篇论文存在数据造假证据。作者称 2021 年与匿名研究团队审查了 Gino 的多项研究,并向哈佛商学院提交了证据最强的四篇论文报告。
推荐理由:作者公开对四篇论文的数据造假证据,并说明哈佛已要求撤稿三篇,可了解学术不端调查与撤稿流程。
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 作者在系列文章的开篇提出,行为科学中许多元分析是无效的,问题集中在两点:一是缺乏质量把关,把有效与无效研究一起平均;二是把不可比的结果合并,例如不同操纵强度或不同结局的研究。
Data Colada 的一篇文章指出,当中介变量 M 与结果变量 Y 在实验之外存在相关时,中介分析会失效。作者 Uri Simonsohn 解释,随机分配只保证 X 对 Y 的估计无偏,一旦在回归中加入 M,b 和 c' 都会产生遗漏变量偏倚,c' 被低估,从而高估中介效应,甚至在没有中介时也看到中介。
Data Colada 对一篇发表于 Nature 的犯罪现场实验提出质疑:该研究将 55 个公共住房楼群随机分配至实验组与对照组,报告干预使前三个月犯罪率下降 6.9%(p = .036),但分析偏离了预注册,且关键操纵存在仅见于原始材料的混淆变量。作者指出,透明性只能证明研究可被评估,不能证明结论有效。
一项针对 2335 份已发表论文附带 R 脚本的自动重跑发现,仅 44% 能无错运行,21% 的失败源于包无法加载。为此发布的 groundhog 2.0 新增支持 GitHub 和 GitLab 包,预计 2022 年 5 月上线 CRAN,此前可用 GitHub 上的 v1.9.9.9999 版本。
一封致《Autism》编辑的信建议,在与孤独症成人开展研究时使用 Autism Quality of Life 量表。该量表专为配合 WHOQoL-BREF 使用而开发。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
Data Colada 与一组匿名研究者分析 Kristal 等人 2020 年公开的原始数据后指出,2012 年发表于 PNAS 的一项现场实验(N = 13,488,由美国东南部一家汽车保险公司实施)存在数据伪造证据。
推荐理由:通过字体、取整和分布异常还原数据造假手法,并说明公开数据为何是发现问题的关键。