通用实验智能体可完成26项在线行为实验,威胁线上行为研究
研究提出仅通过自然语言提示、使用消费级大语言模型订阅开发的通用实验智能体AGEA,在未针对任何具体任务训练的情况下完成了七个托管平台上的26项在线行为实验,并自行推断每项任务的结构。
推荐理由:研究用通用智能体完成26项在线行为实验,提示线上被试真实性假设正面临可迁移的挑战。
人工智能与心理学的交叉:AI 聊天与心理支持、用 AI 做心理学研究、人与 AI 互动的心理影响。
研究提出仅通过自然语言提示、使用消费级大语言模型订阅开发的通用实验智能体AGEA,在未针对任何具体任务训练的情况下完成了七个托管平台上的26项在线行为实验,并自行推断每项任务的结构。
推荐理由:研究用通用智能体完成26项在线行为实验,提示线上被试真实性假设正面临可迁移的挑战。
两项预注册的激励实验用Krupka-Weber规范提取任务,考察人们对人类和大语言模型代为分配资源时的社会适当性判断。英国和美国的代表性样本共N = 2658人参与。
推荐理由:两项预注册实验比较了人们对人类与大语言模型分配资源时的规范判断,可为AI代理设计提供参考。
一项范围综述系统梳理了2007年以来考察心理干预中变化过程的研究,共涉及778项研究、684个治疗变化过程,并借助OpenAI的GPT-5 nano模型以人机协同的迭代聚类方式将其归为32个过程聚类。
推荐理由:综述梳理了2007年以来778项研究中的治疗变化过程,可帮助了解该领域研究重心的分布与多年来的停滞。
一项预注册研究将828名成人随机分配到数字单次干预(SSI)或等待名单,并用机器学习方法开发针对该干预的治疗匹配算法。作者指出,部分数字单次干预对抑郁似乎有效,至少对青少年如此,但并非所有人都能获益,因此尝试用算法识别更适合该干预的人群。研究使用的干预为Common(原文截断)。
推荐理由:研究用机器学习为数字单次干预匹配适合的抑郁患者,提示个性化分配可能改善心理治疗的可及性。
Nature Reviews Psychology的Journal Club文章讨论了对话式AI用于情感支持时的一个特点:这类系统以维持用户参与为目标,因而更倾向于认可用户而非提出质疑。
推荐理由:借Hudon与Stip的论文梳理对话式AI为何更易迎合而非质疑用户,为理解精神病性脆弱人群使用AI的风险提供理论线索。
发表在 Advances in Methods and Practices in Psychological Science 的文章指出,生成式人工智能尤其是大语言模型已嵌入研究过程,越来越多科学家用其协助撰写稿件。作者关注的是能在多大程度上识别出心理学出版物中 LLM 参与的痕迹。
推荐理由:文章讨论如何在心理学论文中识别大语言模型参与写作的痕迹,为期刊与审稿人判断稿件来源提供方法参考。
互动式说服任务显示,OpenAI 的推理模型 o3 在目标心理状态已知时说服表现优异,但在状态隐藏、需要主动询问或推断时仅相当于随机水平。研究包含三项实验,说服者需策略性披露信息,让目标在三个政策提案中做出选择,人类被试在两种条件下表现中等;在由人类扮演目标以及测量人类真实信念是否改变的两项实验中,o3 超过人类说服者,已知条件下差距显著。
推荐理由:研究用互动式说服任务对比大模型与人类的表现,提示静态问答基准未必反映真实的心智推断能力。
一项研究比较了 504 份 LLM 生成与 504 份临床医生撰写的会谈摘要,这些摘要来自 36 次会谈的 108 个五分钟片段,由不知来源的评审者按事实一致性、核心意义保留和临床价值评分。
推荐理由:研究用盲评直接比较了 LLM 与临床医生撰写的会谈摘要,为 AI 辅助记录的工作流提供了分维度的证据。
Nature Reviews Psychology 刊文指出,大语言模型会给人可靠的推理印象,但在临床记录、评估和照护计划中可能引入实质性错误,带来潜在负面后果。作者认为临床工作者需要实际理解这类系统如何运作、在哪些环节出错,并把核查作为安全使用的核心。
推荐理由:文章提醒临床工作者,大语言模型在临床记录与评估中可能引入实质性错误,核查环节不可省略。
研究用243篇真实和262篇编造的自传体故事测试语言测谎,让大语言模型把欺骗性陈述改写得更像真话。当改写与评判目标对齐时,人类判断(d = −0.07 和 d = −0.04)和机器学习判断(51% 准确率)都降到随机水平;未对齐时,人类的细节性启发式判断(d = 0.30 和 d = 0.36)与机器学习预测(63%–78%)仍显著高于随机。
推荐理由:研究用大语言模型改写谎言文本,显示人机测谎在攻击与目标对齐时都会降到随机水平,为语言测谎的可靠性提供了对抗性检验视角。
一项研究让 469 名被试阅读家庭内或家庭外性侵情境并评定罪行严重性与对恢复性司法的支持度,再与 Gemini、Grok 和 DeepSeek 生成的 120 条输出比较。人类与大语言模型都认为家庭内性侵更严重,但在结构化提示条件下,模型给出的恢复性司法支持度评分显著高于人类。人类中感知严重性完全中介了侵害情境与支持度的关系,模型中的中介仅为部分,且不同模型间存在显著差异。
推荐理由:研究对比了人类与三种大语言模型对性侵案件恢复性司法的判断,为理解幸存者求助 AI 时的信息偏差提供参照。
文章指出,在线研究长期依赖“认真、连贯作答即好数据”的质量启发式,但自主AI代理如今几乎能通过所有常规质量检查,这一启发式已不再可靠。作者据此提出AI介导污染的 taxonomy(分类)与风险梯度,并给出相应建议,发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
推荐理由:文章把AI代理污染在线被试数据的风险按类型和梯度梳理,并给出可操作的防范建议,对依赖线上样本的研究者有直接参考价值。
研究开发了基于语言的AI评估工具,用于判断创伤后应激障碍(PTSD)的严重程度,并对其可重复性与效度进行序贯评估,同时完成模型预注册。作者指出,AI通过语言识别精神病理虽具潜力,但模型的可重复性仍是难题。该研究发表于 Clinical Psychological Science,尚属提前在线版本。
推荐理由:研究用患者语言训练AI评估PTSD严重程度,并做模型预注册与序贯验证,可供关注AI心理测量的研究者参考。
一项系统综述分析了1075项实证研究,借助AI辅助提取与人工编码识别并聚类了5000多条构念定义。结果显示,亲社会最常被定义为使他人受益的行为,利他被定义为付出代价、不求回报的无私行动,助人则被定义为即时、情境性的支持;主动性主要面向未来且由自我发起,常超出社会情境。基于反复出现的定义模式,作者提出将利他与助人置于亲社会之下的概念网络,并因概念分歧将主动性排除在外。
推荐理由:系统梳理上千项研究中亲社会、利他与助人概念的定义重叠,为后续测量与操作化提供统一框架。
一项系统综述分析1075项实证研究,考察亲社会性、利他与助人之间的定义重叠与理论不一致。研究借助AI辅助提取与人工编码,识别并聚类了5000多条构念定义,发现亲社会性最常被定义为使他人受益的行为,利他指付出代价、不求回报的无私行动,助人则是即时、情境性的支持。
推荐理由:系统梳理上千项研究中亲社会、利他与助人概念的定义重叠,为统一测量与操作化提供概念框架。