通用实验智能体可完成26项在线行为实验,威胁线上行为研究
研究提出仅通过自然语言提示、使用消费级大语言模型订阅开发的通用实验智能体AGEA,在未针对任何具体任务训练的情况下完成了七个托管平台上的26项在线行为实验,并自行推断每项任务的结构。
推荐理由:研究用通用智能体完成26项在线行为实验,提示线上被试真实性假设正面临可迁移的挑战。
研究设计、统计方法与数据分析实践的进展和争论。
研究提出仅通过自然语言提示、使用消费级大语言模型订阅开发的通用实验智能体AGEA,在未针对任何具体任务训练的情况下完成了七个托管平台上的26项在线行为实验,并自行推断每项任务的结构。
推荐理由:研究用通用智能体完成26项在线行为实验,提示线上被试真实性假设正面临可迁移的挑战。
一项范围综述系统梳理了2007年以来考察心理干预中变化过程的研究,共涉及778项研究、684个治疗变化过程,并借助OpenAI的GPT-5 nano模型以人机协同的迭代聚类方式将其归为32个过程聚类。
推荐理由:综述梳理了2007年以来778项研究中的治疗变化过程,可帮助了解该领域研究重心的分布与多年来的停滞。
一项研究用层级位移-尺度模型和分位数回归分析了64个冲突任务、超过1000万试次的数据,考察冲突效应在反应时分布上是可加还是可乘。结果显示,个体间平均反应时与冲突效应量仅弱相关,因为二者主要由不同参数驱动;Stroop效应在个体内和个体间变异都主要在尺度上,提示可乘的位点,而flanker和Simon效应还包含个体内的可加成分,提示这些任务可能涉及运动成分。
推荐理由:基于千万试次的任务语料比较个体内与个体间变异,提示三类冲突任务并非可互换的控制测量。
一篇综述指出,心理治疗的随机对照试验(RCT)及其元分析仍是循证基础,但常受方法学薄弱、概念混淆和解释困难限制。文章区分了应答与效应、最小重要变化(MIC)与最小 worthwhile 差异(SWD)、绝对与相对效应量,主张以 OR 和 SMD 作为最具可推广性的汇总指标,并用基于 MIC 阈值的对照与实验事件率(CER&EER)补充临床可解释性。
推荐理由:梳理心理治疗随机试验与元分析在效应指标和证据合成上的方法学分歧,并讨论平台试验等提高效率的设计思路。
一项范围综述筛查12,058条记录后纳入2015至2025年间发表的45项研究,用覆盖七个领域、76个提取条目评估其方法学特征,发现理论—干预匹配、因果架构和政策相关性等多个领域普遍存在局限,提示既往结果不一致可能部分源于研究设计与实施薄弱,而非干预效应本身存在差异。
推荐理由:梳理45项社交媒体减量研究的普遍方法学短板,并指出证据人群与限制政策目标人群之间的错位。
发表在 Advances in Methods and Practices in Psychological Science 的文章指出,生成式人工智能尤其是大语言模型已嵌入研究过程,越来越多科学家用其协助撰写稿件。作者关注的是能在多大程度上识别出心理学出版物中 LLM 参与的痕迹。
推荐理由:文章讨论如何在心理学论文中识别大语言模型参与写作的痕迹,为期刊与审稿人判断稿件来源提供方法参考。
一项研究比较了 504 份 LLM 生成与 504 份临床医生撰写的会谈摘要,这些摘要来自 36 次会谈的 108 个五分钟片段,由不知来源的评审者按事实一致性、核心意义保留和临床价值评分。
推荐理由:研究用盲评直接比较了 LLM 与临床医生撰写的会谈摘要,为 AI 辅助记录的工作流提供了分维度的证据。
一项系统综述与元分析汇总了89项随机对照试验(N = 10,219),发现多数参与者在各时间点均未达成身体活动目标,未达成率在57.9%至77.0%之间,且达成率随时间下降。
推荐理由:汇总89项随机对照试验,量化了身体活动目标未达成率随时间上升的趋势,并指出目标由他人设定时达成率更低。
Data Colada 对 Ariely 和 Wertenbroch 2002 年发表于 Psychological Science 的截止日期与拖延研究进行取证分析,发现 Study 1 中“自设截止日期”组有 13 名学生的最终成绩被手动修改,其中 12 处改动方向符合作者假设,去掉这些改动后论文的关键发现即消失。
推荐理由:通过比对早期手稿与发表版本的统计量,可以了解数据篡改如何被逐行还原出来。
文章指出,在线研究长期依赖“认真、连贯作答即好数据”的质量启发式,但自主AI代理如今几乎能通过所有常规质量检查,这一启发式已不再可靠。作者据此提出AI介导污染的 taxonomy(分类)与风险梯度,并给出相应建议,发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
推荐理由:文章把AI代理污染在线被试数据的风险按类型和梯度梳理,并给出可操作的防范建议,对依赖线上样本的研究者有直接参考价值。
一项系统综述与元分析评估了基于健康行动过程取向(HAPA)的健康行为干预效果,纳入74项随机对照试验、197个效应量,共9,115名干预组和8,858名对照组参与者,干预后健康行为总体效应量为d = 0.459。
推荐理由:汇总74项随机对照试验,比较不同干预设计的效果差异,可为健康行为干预的方案设计提供参考。
研究开发了基于语言的AI评估工具,用于判断创伤后应激障碍(PTSD)的严重程度,并对其可重复性与效度进行序贯评估,同时完成模型预注册。作者指出,AI通过语言识别精神病理虽具潜力,但模型的可重复性仍是难题。该研究发表于 Clinical Psychological Science,尚属提前在线版本。
推荐理由:研究用患者语言训练AI评估PTSD严重程度,并做模型预注册与序贯验证,可供关注AI心理测量的研究者参考。
一项对100项心理治疗研究的描述性综述发现,患者年龄和性别分别有83.8%和95%的研究报告,而教育程度为46%、种族为50%,性取向(12%)、社会经济地位(12%)、移民(5%)、农村(3%)和残障(2%)极少报告。
推荐理由:对100项心理治疗研究的描述性综述显示,样本与治疗情境信息报告普遍不足,可帮助判断研究结论能推广到哪些人群。
一项系统综述分析了1075项实证研究,借助AI辅助提取与人工编码识别并聚类了5000多条构念定义。结果显示,亲社会最常被定义为使他人受益的行为,利他被定义为付出代价、不求回报的无私行动,助人则被定义为即时、情境性的支持;主动性主要面向未来且由自我发起,常超出社会情境。基于反复出现的定义模式,作者提出将利他与助人置于亲社会之下的概念网络,并因概念分歧将主动性排除在外。
推荐理由:系统梳理上千项研究中亲社会、利他与助人概念的定义重叠,为后续测量与操作化提供统一框架。
一项系统综述分析1075项实证研究,考察亲社会性、利他与助人之间的定义重叠与理论不一致。研究借助AI辅助提取与人工编码,识别并聚类了5000多条构念定义,发现亲社会性最常被定义为使他人受益的行为,利他指付出代价、不求回报的无私行动,助人则是即时、情境性的支持。
推荐理由:系统梳理上千项研究中亲社会、利他与助人概念的定义重叠,为统一测量与操作化提供概念框架。
研究提出 MATCH 框架,结合档案数据与计算机算法,把来访者匹配给治疗师,使平均疗效优于分配给下一位可预约的治疗师,同时兼顾治疗师的可用性。研究使用某大型私立大学咨询中心 2014 至 2019 年的 CCAPS-62 与 OQ-45 数据,共 10,100 个治疗疗程,并通过模拟和统计检验评估该方法。
推荐理由:用真实咨询数据演示机器学习匹配来访者与治疗师,并说明在治疗师排班受限时仍可能改善疗效。
研究开发了一套面向庇护官员的75小时混合式法律心理学培训,并用带等待名单对照组的准实验前后测设计评估效果。培训在记忆与访谈等主题的知识及提问能力测试上产生较大即时效应(d = 1.67),5个月随访后提升仍然保持。作者指出,后续研究需要考察这些知识能否迁移到实际的庇护裁决中。
推荐理由:针对庇护官员的法律心理学培训显示,知识测试成绩在培训后大幅提升并维持五个月,为司法决策培训提供了可参考方案。