心理治疗师成为研究对象时研究伦理的复杂性:心理治疗研究中的权力、隐私与职业边界
心理治疗师作为研究对象时,研究伦理面临权力、隐私与职业边界三重复杂性。文章发表于 Psychotherapy Research 第36卷第7期,聚焦心理治疗研究中治疗师转为被试所带来的伦理挑战。
心理治疗师作为研究对象时,研究伦理面临权力、隐私与职业边界三重复杂性。文章发表于 Psychotherapy Research 第36卷第7期,聚焦心理治疗研究中治疗师转为被试所带来的伦理挑战。
统计期刊 JASA 即将发表对 p-curve 的批评,指出其存在四种不良统计特性,包括对接近 .05 或 .025 截断值的 p 值过度敏感、单调性可能被违反等。p-curve 开发者回应称,模拟显示单调性违反仅在 0.2%–2.8% 的模拟中出现,加入 p = .04988 的极端值后检验力下降 0.1%–5%,且 p-curve 应用已内置排除极端值的稳健性检验。
一项发表于 QJE 的 LinkedIn 审计研究通过约 400 个虚构年轻男性账号发送了 3 万多条连接请求,发现黑人照片的连接接受率更低,但接受后获得职业建议的比例相当。Data Colada 指出该研究虽在随机化和刺激配对设计上颇为精巧,但 197 对 AI 生成照片在吸引力上高度相似,刺激材料多样性不足,可能限制结论的推广。
Data Colada 作者 Joe Simmons 分析 Nature Human Behaviour 2023 年一项关于科学相关错误信息纠正效果的元分析,该文摘要称纠错尝试平均而言不成功(d = 0.11,p = .142)。
Data Colada 作者 Uri Simonsohn 与 Andres Montealegre、Ioannis Evangelidis 在即将发表于 JPSP 的论文《Stimulus Sampling Reimagined》中提出,刺激选择应着眼于内部效度而非外部效度,并主张用刺激图分析各刺激的结果差异。
针对 Oprea 对“复杂性”批评的回应,本文指出其数据并不支持中位数“不稳定”和“不具代表性”两点主张。在 150 次自助抽样中,多数镜像前景的中位数标准误为 0,取值完全一致;而被质疑的聚合中位数 CDF 排除了 G50 和 L50 两个前景,且聚合中位数并非作者实际分析的对象。按均值与中位数附近观测占比比较,中位数代表性明显更高,且中位数准确复现了彩票与镜像的差异及前景理论预测模式。
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
一项研究在澳大利亚男性严重暴力犯罪者样本中检验了 LSI-R:SV、LS/RNR 与 VRS 三种风险评估工具的效度。该研究发表于 Psychology, Crime & Law 第 32 卷第 9 期。
Data Colada 发文指出,Hainmueller、Mummolo 和 Xu(HMX)2019 年提出的分箱估计量在观察数据中常存在偏差,双方分歧的核心在于分析交互作用时是否应遵循 ceteris paribus。作者以博士招生为例说明,当交互项中的变量相关时,非线性会污染交互效应估计,而 HMX 所选估计目标并未反映研究者真正想问的问题。
一项发表于 Psychology, Crime & Law 的研究考察了实务工作者对讯问程序的支持受哪些因素驱动,聚焦程序公正评估。研究结果提示程序公正感知与实务工作者对讯问程序的支持程度有关。
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
Data Colada指出,2019年发表于Political Analysis、被引超1000次的交互效应"分箱估计量"不应再用于观察数据。当焦点预测变量x与调节变量z相关、且x或z对y存在非线性影响时,该估计量与线性回归的交互项d同样有偏,会产生假阳性交互和符号错误的边际效应。作者建议改用GAM。
行为科学与临床试验中常用的组间设计无法直接判断单个被试是否受处理影响,KS 检验的 D+ 与 D- 统计量可作为这一比例的上下界。以一项 $50 礼品券与 50:50 彩票的估值实验为例,D+ 约为 55%、D- 约为 18%,即至少 55% 的被试对礼品券估值更高、至少 18% 相反。
Data Colada 指出,一篇即将发表于 Psych Methods 的论文让编码者评估 300 份预注册,结论是心理学预注册(尤其依赖 AsPredicted 模板者)信息不足,但未发现预注册随时间变得更有信息量、也未发现发表研究偏离预注册的显著效应。
Data Colada作者Joe Simmons称,因Francesca Gino起诉其诽谤,哈佛一份1288页调查报告被公开,其中披露了Gino、Kouchaki和Casciaro(2020)研究3A的原始数据集。
一项对2022年 Psych Science、JEP:G、JPSP 和 JCR 四本期刊论文的统计发现,约43%的论文至少有一项研究做了预注册,且该比例在可预注册研究中更高。约半数指向 AsPredicted 的链接为仅供同行评审的匿名版本,约17%的 OSF 链接指向匿名项目页。作者建议期刊要求作者说明未预注册理由、核查链接,并采用单一仓库链接。
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 作者在系列文章的开篇提出,行为科学中许多元分析是无效的,问题集中在两点:一是缺乏质量把关,把有效与无效研究一起平均;二是把不可比的结果合并,例如不同操纵强度或不同结局的研究。
Data Colada 的一篇文章指出,当中介变量 M 与结果变量 Y 在实验之外存在相关时,中介分析会失效。作者 Uri Simonsohn 解释,随机分配只保证 X 对 Y 的估计无偏,一旦在回归中加入 M,b 和 c' 都会产生遗漏变量偏倚,c' 被低估,从而高估中介效应,甚至在没有中介时也看到中介。
Data Colada 对一篇发表于 Nature 的犯罪现场实验提出质疑:该研究将 55 个公共住房楼群随机分配至实验组与对照组,报告干预使前三个月犯罪率下降 6.9%(p = .036),但分析偏离了预注册,且关键操纵存在仅见于原始材料的混淆变量。作者指出,透明性只能证明研究可被评估,不能证明结论有效。
一项针对 2335 份已发表论文附带 R 脚本的自动重跑发现,仅 44% 能无错运行,21% 的失败源于包无法加载。为此发布的 groundhog 2.0 新增支持 GitHub 和 GitLab 包,预计 2022 年 5 月上线 CRAN,此前可用 GitHub 上的 v1.9.9.9999 版本。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
一项分析462场经济学研讨会提问的NBER论文称女性演讲者被提问更多且问题更具居高临下或敌意,但Data Colada的解读认为该结论证据不足。数据显示女性演讲者获得约多3个提问,差异主要来自男性更常被提问过少;敌意与居高临下问题的效应量小且统计证据薄弱(p=.1和p=.02),其他指标方向不一致。
Data Colada 作者 Uri Simonsohn 推出 R 包 groundhog,用 groundhog.library() 替代 library(),只需额外输入一个日期,即可加载该日期在 CRAN 上的包版本及其全部依赖,使同一段代码在不同电脑上长期得到相同结果。
Data Replicada 第9期复制了 Journal of Marketing Research 一篇关于减重产品广告的研究,原研究(N = 213)发现渐进式广告比"前后对比"广告更可信。
ResearchBox 是一个便于研究者共享数据、代码、材料和预注册的新平台,设计思路类似 AsPredicted,但比 OSF 更聚焦于向读者共享研究支撑材料,不提供项目分叉、多作者子组件、wiki 协作或 AWS 集成等功能。
Data Replicada 对一篇 JMR 左位数偏差论文的研究1(N = 145)开展两项预注册重复验证,重复1(N = 1,099)与重复2(N = 1,555)均仅发现边缘显著的交互,即价格同屏呈现时左位数偏差方向性更大,但证据远弱于原研究。原研究仅有9.3%和7.8%的检验力检出两次重复结果,需3,000至4,500名被试才有80%把握检出。
Uri Simonsohn 针对即将刊于 AER 的论文《Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics》提出质疑。
Data Colada的重复验证未能复现Journal of Consumer Research一项研究的结果:展示五瓶滴露(vs.一瓶)并未显著提高被试对产品效果的评分。三次预注册重复验证样本量至少为原研究(N=87)的6.5倍,最支持原假设的第三次重复中效应量仅为d=.10,远小于原研究的d=.43。
Data Colada 的 Data Replicada 项目尝试重复验证 Journal of Consumer Research 一篇关于资源稀缺与价格质量判断的研究,重复实验中稀缺组的价格质量相关低于对照组,但效应量 d = .15,远小于原研究的 d = .42。
《Personality and Social Psychology Review》期刊编辑就 Benjamin、Kepes 与 Bushman(2017)关于武器对攻击性思维、愤怒情绪、敌意评价及攻击行为影响的研究发表关注声明。该声明针对这篇已在线发表的文章,具体关注内容未在声明中详述。
一项研究考察了矫正干预中风险水平与治疗剂量的交互作用。风险原则主张,有效干预应按犯罪者风险调整治疗强度,高风险者应获得比低风险者更密集的服务。