statuser:让 R 的 t 检验、列联表与描述统计输出更易读的 R 包
心理学研究者发布 R 包 statuser,已上线 CRAN,可用 install.packages('statuser') 安装。其 t.test2() 在保留 t.test() 后端的同时直接报告均值差,table2() 一次调用即可输出列联表比例与卡方检验,desc_var() 按组给出含缺失值和唯一值数量的描述统计。
心理学研究者发布 R 包 statuser,已上线 CRAN,可用 install.packages('statuser') 安装。其 t.test2() 在保留 t.test() 后端的同时直接报告均值差,table2() 一次调用即可输出列联表比例与卡方检验,desc_var() 按组给出含缺失值和唯一值数量的描述统计。
这篇综述梳理了近年来数字与计算方法在理解、预测和预防自杀方面的进展。作者指出,自杀数十年来一直是主要死因,尽管已有大量研究,其发生率仍未下降。文章发表于 Current Directions in Psychological Science 第35卷第4期,页码232-239。
一项发表在 Clinical Psychological Science 的研究基于 HiTOP 框架,考察了认知注意(oddball P300)与知觉相关的事件相关电位指标,如何对应外化谱系的广谱维度与特定维度。研究区分了广谱与特定维度各自关联的不同事件相关电位生物标志物。
针对 Nedergaard 和 Lupyan(2024)用四项研究验证无内心言语(anendophasia)的做法,Lind(2025)认为包括该研究在内尚无人证明无内心言语存在。这篇评论以无内心言语为例,讨论研究中的保真度与效度问题。
一项生态瞬时评估研究检验了紧迫感(以强烈情绪驱动冲动行为的特质)是否调节情感与酒精使用之间的关联。结果显示,情感与紧迫感的交互作用可预测日常生活中的酒精和大麻使用,而此前该假设在生态瞬时评估研究中得到的支持并不一致。
一项多研究多方法设计(视频情境实验与实地研究)发现,当领导者-成员交换(LMX)差异化与员工人口学特征关联较弱时,多元气候更积极。多元气候的协同视角与单元想法生成正相关,而公平与歧视视角则未获支持。
一项发表于JEP:G、声称生成式AI使用与创造力呈倒U形关系的研究(Study 3),其U形被指为伪影。该研究对创意工作者做两波调查,由主管用九项量表评定创造力,二次项显著。但加入置信带后,单调关联远未被排除;改用two-lines检验后U形不显著(p = .81)。作者指出,38%的数据集中在AI使用1–2分区间,二次回归为拟合该处陡峭斜率而被迫在高分区弯出负斜率。
一项访谈研究以 22 名有 AI 训练经验的竞技电竞选手为对象,用认知网络分析(ENA)考察人机团队(HATs)的培训需求如何随任务专长而异。当前培训多聚焦用 AI 做任务训练,不同专长者对其看法分歧,并在适应性与可预测性、与 AI 共同训练的态度上存在张力。研究提出未来培训应深化人与 AI 的理解与信任,关注社会情感联结和角色意识。
ResearchBox 新增 Zenodo 备份并为每个公开数据盒生成 DOI,同时放宽数据代码本要求、优化上传分组并打通 AsPredicted 账号。一项 N=30 的随机调查显示,被试在 ResearchBox 上判断数据是否可获取、下载研究材料的速度和易用性评价均优于 OSF,其中成功回答 Study 4 数据问题的中位耗时分别为 31 秒和 126 秒。
一项发表于 Clinical Psychological Science 的研究采用改编的信念更新范式,考察抑郁症状与个体内信念更新轨迹的关系。结果显示,抑郁症状与积极表现反馈的整合减少有关,即患者更难依据正面表现反馈修正既有负面预期。
开放性/智力在大五人格特质中常显独特,其历史遗留的争议至今未解。发表于 Personality and Social Psychology Review 的这篇文章审视了使该特质与众不同的多种特性,并探讨了这些独特性对研究与测量的意义。
统计期刊 JASA 即将发表对 p-curve 的批评,指出其存在四种不良统计特性,包括对接近 .05 或 .025 截断值的 p 值过度敏感、单调性可能被违反等。p-curve 开发者回应称,模拟显示单调性违反仅在 0.2%–2.8% 的模拟中出现,加入 p = .04988 的极端值后检验力下降 0.1%–5%,且 p-curve 应用已内置排除极端值的稳健性检验。
一项发表于 QJE 的 LinkedIn 审计研究通过约 400 个虚构年轻男性账号发送了 3 万多条连接请求,发现黑人照片的连接接受率更低,但接受后获得职业建议的比例相当。Data Colada 指出该研究虽在随机化和刺激配对设计上颇为精巧,但 197 对 AI 生成照片在吸引力上高度相似,刺激材料多样性不足,可能限制结论的推广。
Data Colada 作者 Joe Simmons 分析 Nature Human Behaviour 2023 年一项关于科学相关错误信息纠正效果的元分析,该文摘要称纠错尝试平均而言不成功(d = 0.11,p = .142)。
Data Colada 作者 Uri Simonsohn 与 Andres Montealegre、Ioannis Evangelidis 在即将发表于 JPSP 的论文《Stimulus Sampling Reimagined》中提出,刺激选择应着眼于内部效度而非外部效度,并主张用刺激图分析各刺激的结果差异。
针对 Oprea 对“复杂性”批评的回应,本文指出其数据并不支持中位数“不稳定”和“不具代表性”两点主张。在 150 次自助抽样中,多数镜像前景的中位数标准误为 0,取值完全一致;而被质疑的聚合中位数 CDF 排除了 G50 和 L50 两个前景,且聚合中位数并非作者实际分析的对象。按均值与中位数附近观测占比比较,中位数代表性明显更高,且中位数准确复现了彩票与镜像的差异及前景理论预测模式。
Data Colada 博主 Uri Simonsohn 与 Daniel Banki、Robert Walatka、George Wu 合作,对一篇发表在 American Economic Review、质疑前景理论的论文提出评论。
Data Colada 发文指出,Hainmueller、Mummolo 和 Xu(HMX)2019 年提出的分箱估计量在观察数据中常存在偏差,双方分歧的核心在于分析交互作用时是否应遵循 ceteris paribus。作者以博士招生为例说明,当交互项中的变量相关时,非线性会污染交互效应估计,而 HMX 所选估计目标并未反映研究者真正想问的问题。
一篇即将发表于 QJE 的田野实验称,训练警察“从不同角度解读所遇情境”可减少武力使用与自由裁量逮捕,但作者比对预注册与发表结果后认为这些发现并不真正具有统计显著性。
Data Colada指出,2019年发表于Political Analysis、被引超1000次的交互效应"分箱估计量"不应再用于观察数据。当焦点预测变量x与调节变量z相关、且x或z对y存在非线性影响时,该估计量与线性回归的交互项d同样有偏,会产生假阳性交互和符号错误的边际效应。作者建议改用GAM。
行为科学与临床试验中常用的组间设计无法直接判断单个被试是否受处理影响,KS 检验的 D+ 与 D- 统计量可作为这一比例的上下界。以一项 $50 礼品券与 50:50 彩票的估值实验为例,D+ 约为 55%、D- 约为 18%,即至少 55% 的被试对礼品券估值更高、至少 18% 相反。
Data Colada 指出,一篇即将发表于 Psych Methods 的论文让编码者评估 300 份预注册,结论是心理学预注册(尤其依赖 AsPredicted 模板者)信息不足,但未发现预注册随时间变得更有信息量、也未发现发表研究偏离预注册的显著效应。
Data Colada作者Joe Simmons称,因Francesca Gino起诉其诽谤,哈佛一份1288页调查报告被公开,其中披露了Gino、Kouchaki和Casciaro(2020)研究3A的原始数据集。
一项对2022年 Psych Science、JEP:G、JPSP 和 JCR 四本期刊论文的统计发现,约43%的论文至少有一项研究做了预注册,且该比例在可预注册研究中更高。约半数指向 AsPredicted 的链接为仅供同行评审的匿名版本,约17%的 OSF 链接指向匿名项目页。作者建议期刊要求作者说明未预注册理由、核查链接,并采用单一仓库链接。
Data Colada 系列文章指出,元分析均值常因纳入无效假设检验和不可通约的结果而失去意义。以 2019 年 Psychological Bulletin 发表的不诚实行为元分析为例,该研究分析 558 项研究后得出掷骰任务中撒谎比例为 52%、抛硬币任务为 30%,但作者认为两类任务设计差异过大,无法有效比较或合并。
Data Colada 在系列文章第二篇中指出,元分析平均值常常没有意义,因为其中包含对元分析研究问题的无效检验,并把不可比的结果合并在一起。
Data Colada 指出,PNAS 一篇元分析将 447 个“助推”效应合并得出平均效应量 Cohen's d = 0.43,但这类均值往往没有意义,因为合并了本质上不可通约的结果。
Data Colada 作者在系列文章的开篇提出,行为科学中许多元分析是无效的,问题集中在两点:一是缺乏质量把关,把有效与无效研究一起平均;二是把不可比的结果合并,例如不同操纵强度或不同结局的研究。
Data Colada 的一篇文章指出,当中介变量 M 与结果变量 Y 在实验之外存在相关时,中介分析会失效。作者 Uri Simonsohn 解释,随机分配只保证 X 对 Y 的估计无偏,一旦在回归中加入 M,b 和 c' 都会产生遗漏变量偏倚,c' 被低估,从而高估中介效应,甚至在没有中介时也看到中介。
Data Colada 对一篇发表于 Nature 的犯罪现场实验提出质疑:该研究将 55 个公共住房楼群随机分配至实验组与对照组,报告干预使前三个月犯罪率下降 6.9%(p = .036),但分析偏离了预注册,且关键操纵存在仅见于原始材料的混淆变量。作者指出,透明性只能证明研究可被评估,不能证明结论有效。
一项针对 2335 份已发表论文附带 R 脚本的自动重跑发现,仅 44% 能无错运行,21% 的失败源于包无法加载。为此发布的 groundhog 2.0 新增支持 GitHub 和 GitLab 包,预计 2022 年 5 月上线 CRAN,此前可用 GitHub 上的 v1.9.9.9999 版本。
被引最多的2019年QJE论文《Channeling Fisher》称随机化检验优于回归,但该结论仅在依赖Stata默认的HC1稳健标准误时成立。改用R默认的HC3后,随机化检验的优越性消失——问题出在Stata默认设置,而非随机化检验本身。
一项分析462场经济学研讨会提问的NBER论文称女性演讲者被提问更多且问题更具居高临下或敌意,但Data Colada的解读认为该结论证据不足。数据显示女性演讲者获得约多3个提问,差异主要来自男性更常被提问过少;敌意与居高临下问题的效应量小且统计证据薄弱(p=.1和p=.02),其他指标方向不一致。
Data Colada 作者 Uri Simonsohn 推出 R 包 groundhog,用 groundhog.library() 替代 library(),只需额外输入一个日期,即可加载该日期在 CRAN 上的包版本及其全部依赖,使同一段代码在不同电脑上长期得到相同结果。
Data Replicada 第9期复制了 Journal of Marketing Research 一篇关于减重产品广告的研究,原研究(N = 213)发现渐进式广告比"前后对比"广告更可信。
ResearchBox 是一个便于研究者共享数据、代码、材料和预注册的新平台,设计思路类似 AsPredicted,但比 OSF 更聚焦于向读者共享研究支撑材料,不提供项目分叉、多作者子组件、wiki 协作或 AWS 集成等功能。
Data Replicada 对一篇 JMR 左位数偏差论文的研究1(N = 145)开展两项预注册重复验证,重复1(N = 1,099)与重复2(N = 1,555)均仅发现边缘显著的交互,即价格同屏呈现时左位数偏差方向性更大,但证据远弱于原研究。原研究仅有9.3%和7.8%的检验力检出两次重复结果,需3,000至4,500名被试才有80%把握检出。
Uri Simonsohn 针对即将刊于 AER 的论文《Methods Matter: P-Hacking and Publication Bias in Causal Analysis in Economics》提出质疑。
Data Colada的重复验证未能复现Journal of Consumer Research一项研究的结果:展示五瓶滴露(vs.一瓶)并未显著提高被试对产品效果的评分。三次预注册重复验证样本量至少为原研究(N=87)的6.5倍,最支持原假设的第三次重复中效应量仅为d=.10,远小于原研究的d=.43。
Data Colada 的 Data Replicada 项目尝试重复验证 Journal of Consumer Research 一篇关于资源稀缺与价格质量判断的研究,重复实验中稀缺组的价格质量相关低于对照组,但效应量 d = .15,远小于原研究的 d = .42。