Nature Human Behaviour 评论:AI 放大专家能力,却无助于培养专业能力
Nature Human Behaviour 刊发的一篇评论指出,AI 工具能放大人们已有的能力,但获取知识与专业能力本是一个漫长过程,这可能给下一代专家的培养带来问题。该评论由 Sheng-Tun Li 撰写,发表于 2026 年 9 月 29 日。
Nature Human Behaviour 刊发的一篇评论指出,AI 工具能放大人们已有的能力,但获取知识与专业能力本是一个漫长过程,这可能给下一代专家的培养带来问题。该评论由 Sheng-Tun Li 撰写,发表于 2026 年 9 月 29 日。
一项回顾性预测模型研究利用 Epic Cosmos 电子病历数据,纳入 322,879 名孤独症谱系障碍且共病心境或精神病性障碍的个体,仅用前一次就诊及之前可获得的信息预测下一次就诊时的自杀未遂。
研究发现,与AI聊天机器人的互动会外溢到人际交往中:两项共逾4000名参与者的实验显示,先与机器人合作的被试随后对真人更不合作,共情水平下降且不会立即恢复。另一项AI聊天机器人实验也发现,与机器人短暂协作的人对同伴更具工具性和苛求,并更严苛地评价他人的工作。
一项发表于 Developmental Science 的计算建模研究提出“自我先验”(self-prior)密度模型,在基于自由能原理的主动推理框架下,让智能体仅凭内在过程自发产生目标导向行为。该机制通过最小化过去多模态感觉经验与当前观察之间的失配来生成行为参照,类似身体图式的习得与运用。在模拟环境中,智能体自发向触觉刺激(贴纸)伸手,无需外部奖励。
Gagné 等人在 2022 年春发表了一篇关于未来工作心理学的综述,几个月后 ChatGPT 发布,但该文并未过时,反而更具相关性。该综述以自我决定理论为基础,主张动机与幸福感随胜任感、自主性和归属感三种基本心理需要的满足而升降。
一项预注册研究将828名成人随机分配到数字单次干预(SSI)或等待名单,并用机器学习方法开发针对该干预的治疗匹配算法。作者指出,部分数字单次干预对抑郁似乎有效,至少对青少年如此,但并非所有人都能获益,因此尝试用算法识别更适合该干预的人群。研究使用的干预为Common(原文截断)。
推荐理由:研究用机器学习为数字单次干预匹配适合的抑郁患者,提示个性化分配可能改善心理治疗的可及性。
Nature Reviews Psychology的Journal Club文章讨论了对话式AI用于情感支持时的一个特点:这类系统以维持用户参与为目标,因而更倾向于认可用户而非提出质疑。
推荐理由:借Hudon与Stip的论文梳理对话式AI为何更易迎合而非质疑用户,为理解精神病性脆弱人群使用AI的风险提供理论线索。
一篇发表于 Nature Human Behaviour 的评论文章提出,AI 陪伴以低成本提供情感连接,但其影响并非均匀分布。当用户自身的脆弱性、平台控制的漏洞与治理缺口同时出现时,这类系统可能让脆弱用户暴露于更多风险,从而加深社会不平等。
一项预印本研究用LLaMA和BERT的(伪)困惑度分析儿童期起病精神病(COP)患者(N=23,平均12.78岁)与对照(N=15,平均11.67岁)的访谈转录文本,发现LLaMA困惑度在COP组与年龄呈显著负相关、在对照组不显著,且病例状态可显著预测困惑度,BERT伪困惑度则无此关联。作者认为这反映了COP患者实时语义与句法规划的发育轨迹异常。
发表在 Advances in Methods and Practices in Psychological Science 的文章指出,生成式人工智能尤其是大语言模型已嵌入研究过程,越来越多科学家用其协助撰写稿件。作者关注的是能在多大程度上识别出心理学出版物中 LLM 参与的痕迹。
推荐理由:文章讨论如何在心理学论文中识别大语言模型参与写作的痕迹,为期刊与审稿人判断稿件来源提供方法参考。
诺贝尔奖得主 2015 年的一篇论文被永久标注“关注”,其撤稿数量在诺奖得主撤稿榜上以 15 篇居首。美国司法部官员在 2025 年就“党派”观点质询了十余家期刊。此外,AI 生成科学存在“合成效度”问题,一项调查显示四分之三的研究者不确定该披露哪些 AI 使用情况。
分析显示,使用生成式AI查询健康问题的美国大学生焦虑和抑郁筛查阳性几率更高。研究基于96,205名美国大学生的全国代表性样本,采用复杂抽样多变量logistic回归并控制人口学特征。
互动式说服任务显示,OpenAI 的推理模型 o3 在目标心理状态已知时说服表现优异,但在状态隐藏、需要主动询问或推断时仅相当于随机水平。研究包含三项实验,说服者需策略性披露信息,让目标在三个政策提案中做出选择,人类被试在两种条件下表现中等;在由人类扮演目标以及测量人类真实信念是否改变的两项实验中,o3 超过人类说服者,已知条件下差距显著。
推荐理由:研究用互动式说服任务对比大模型与人类的表现,提示静态问答基准未必反映真实的心智推断能力。
精神医学下一代大数据需要更多理论驱动、更多个体内数据,并更好地整合人工智能。相关论述发表于 World Psychiatry 第25卷第3期。
《World Psychiatry》2026年10月刊发文章,讨论人工智能与心理健康领域正在浮现的新现实。文章刊于第25卷第3期,页码386-387。
精神医学研究已从单中心、小样本转向多中心、大样本、多变量,覆盖社区与登记调查、队列与生物样本库、电子健康记录、数字表型、脑影像、基因组学及随机对照试验。大样本并不保证更精确的估计,仍需关注数据质量与方法严谨性;大数据揭示了精神障碍机制的复杂性、异质性与变异性,也凸显了大小规模研究相互印证的必要。
美国心理学会上月年在华盛顿特区举行的年会吸引60个国家近8000人到场,设523场会议、1180位讲者。黑人女性健康促进会主席Joy D. Calloway指出,人们在工作与家庭中尚能运转并不代表其处于良好状态,长期压力会累积为生物学损害。心理学家Ali Mattu称来访者诉求已从压力焦虑转向绝望、不堪重负与意义感。
生成式 AI 正快速进入教育领域,被定位为提升效率与实现个性化的工具。这篇 Perspective 指出,这一定位掩盖了更深层的转变。文章发表于 Communications Psychology。
一项对MindApps.org数据库中865款心理健康应用的五年纵向生存分析发现,464款(53.6%)在2,142天的研究期内被下架。不同临床目标的应用生存期存在差异,戒烟类应用下架风险最高,睡眠类应用生存期最长;仅支持安卓而不兼容iOS是应用被下架最突出的特征,其下架风险是其他应用的2.32倍(Cox回归C-index=0.77,随机森林AUC=0.82)。
两项多来源多轮次调查显示,领导与AI协作通过提升团队反思维和团队角色宽度自我效能,进而改善团队绩效,领导年龄增强了这两条路径;团队角色超载的中介作用结果不一致。研究提示领导与AI协作对团队有益,年长领导在数字化时代可能更具优势。
一项并行嵌入式混合方法研究以 50 名咨询学生为对象,考察 ChatGPT 对咨询技能自我效能的支持作用。前后测双向混合设计方差分析显示交互效应显著,在应对挑战性来访者(尤其是建立关系)的效能感上效应量较大(partial η² = 0.185)。对学生反思的主题分析归纳出使用 ChatGPT-4o 练习咨询技能的 5 项积极体验与 6 项主要挑战。
两项发表于 Cell 和 Science 的研究发现,放射状胶质细胞的分化决策受两类信号调控:Cell 研究显示葡萄糖代谢中的磷酸戊糖途径可主动影响其生成的细胞类型,Science 研究则发现丘脑投射纤维通过物理接触促使干细胞产生更多兴奋性神经元,且该效应在携带 NRXN1 突变的孤独症相关模型中发生改变。
关系科学家指出,目前尚无坚实的科学基础支撑约会应用的 AI 匹配算法,研究者其实并不知道究竟是什么让两个特定的人彼此合适。已有研究显示,相似性或许能在见面之前预测吸引力,但一旦发生哪怕短暂互动,相似性与喜欢的关联就大幅减弱;人们还会因"和哥哥同名""发型不好"等无关理由排除潜在对象。该研究者所在实验室正开展系列研究,将约会应用数据与真实互动结合,以检验线上"化学反应"能否转化为现实中的火花。
Nature Reviews Psychology 刊文指出,大语言模型会给人可靠的推理印象,但在临床记录、评估和照护计划中可能引入实质性错误,带来潜在负面后果。作者认为临床工作者需要实际理解这类系统如何运作、在哪些环节出错,并把核查作为安全使用的核心。
推荐理由:文章提醒临床工作者,大语言模型在临床记录与评估中可能引入实质性错误,核查环节不可省略。
马萨诸塞大学陈医学院助理教授 Andres Colubri 的 Epigame 研究用手机游戏结合蓝牙近距离感应模拟疫情传播,通过随机对照试验检验提高自愿隔离的游戏内成本是否改变人们的隔离选择。该研究已在 OSF 注册,并在数据促使团队拒绝原假设后更新了预注册。Colubri 将预注册视为研究者自建的“科学可重复性封印”,论文只是研究记录的一部分。
一篇发表于JAMA Psychiatry的观点文章讨论了将大语言模型(LLM)用作临床工具以改善照护时,在培训心理健康临床医生和落地机构工作流程方面需要考虑的问题。文章聚焦于如何让LLM的推理过程可被验证。
一项发表于 Science Advances 的研究提出,脑进化可能不是在新脑区之上叠加旧脑区,而是在有限脑空间里分配两种布线策略。研究者比较了182个物种的边缘系统与新皮层,发现边缘系统各区域往往同步变大或变小,而新皮层相应变小;用人工神经网络模拟时,偏好嗅觉的环境让分布式“条形码式”网络扩张、新皮层缩小,偏好视觉时则相反。作者认为,这一机制或可帮助构建所需训练数据和能耗更少的AI系统。
文章提出,智能源于灵活、领域通用的大脑与结构化、领域优化的身体之间的适配:大脑具有高度可塑性,可形成多种可能的功能结构,而身体为经验提供结构化来源。该框架同时用于解释生物智能与人工智能的发展。
生成式人工智能(GenAI)正在迅速改变青少年发展的环境,既带来机会也带来风险。青春期是完成关键心理社会发展任务的生命敏感期,该文探讨了将青少年发展过程自动化所涉及的高风险。
爱荷华大学团队让38名18至35岁被试学习颜色、面孔与场景的关联后更改配对规则,结合fMRI与计算模型发现,前顶叶皮层并非固定不变地与全脑通信,而是随决策阶段所需信息动态调整连接模式。研究者指出,该信息整合功能异常可能与ADHD和精神分裂症中难以根据情境变化调整行为有关。
一项发表于 Journal of Organizational Behavior 的特刊指出,AI 正在重塑集体工作过程,而不只是影响个体判断。八项研究考察了拟人化与性别化线索如何影响对 AI 的感知,AI 如何改变决策、信任与压力等团队过程,以及培训与组织整合如何影响可持续的人机协作。作者据此提出区分 AI 在工作社会系统中的位置与其能动性大小的框架,并主张以团队而非二元组合作为分析单位。
研究用243篇真实和262篇编造的自传体故事测试语言测谎,让大语言模型把欺骗性陈述改写得更像真话。当改写与评判目标对齐时,人类判断(d = −0.07 和 d = −0.04)和机器学习判断(51% 准确率)都降到随机水平;未对齐时,人类的细节性启发式判断(d = 0.30 和 d = 0.36)与机器学习预测(63%–78%)仍显著高于随机。
推荐理由:研究用大语言模型改写谎言文本,显示人机测谎在攻击与目标对齐时都会降到随机水平,为语言测谎的可靠性提供了对抗性检验视角。
一项基于虚拟现实的研究设计了自我参照复杂试次协议(CTP),通过测量早期后部负波(EPN)区分有罪者与知情无辜者。有罪组在无关刺激与探针间的EPN波幅差异显著大于知情及不知情无辜组,区分有罪者与知情无辜者的AUC = 0.90,与不知情无辜者的AUC = 0.88。
Personnel Psychology 发表“40问”系列文章,以简明的循证回答覆盖团队的定义与使能条件、构成与多样性、认知、冲突、情感、学习、领导与教练、高管团队与董事会、多团队系统,以及混合办公和人工智能(AI)的影响。文章提炼出四条整合主题:团队效能根本上由设计塑造;个体能力须被激活并整合才能产生集体绩效;系统规模扩大时协调挑战发生质变;技术工具放大而非取代核心团队协作机制。
Personnel Psychology 刊发"40 个问题"系列,围绕人工智能在工业与组织(I/O)心理学、人力资源(HR)和组织行为(OB)研究与实践中的作用,从专业网络中征集问题并整理成主题,涵盖 AI 是什么、其技术组成、AI 用于研究的新兴最佳实践、评审 AI 相关工作的指引,以及在评审中使用 AI。
针对人工神经网络与生物大脑表征高度对齐被解读为"普遍表征"的观点,作者提出 Umwelt 表征假说,认为这种对齐并非收敛于单一全局最优,而源于系统发展所处生态约束的重叠。综述的实证证据显示,物种、个体与人工神经网络之间的表征差异具有系统性和适应性,难以用普遍性解释。作者据此主张将人工神经网络模型比较重新定位为绘制生态约束空间中对齐簇的方法,而非寻找单一最优世界模型。
一项由加州大学旧金山分校和贝斯以色列女执事医疗中心研究人员领导的研究,用机器学习模型结合睡眠脑电(EEG)中的13个微观特征估算“脑龄”,发现估算脑龄比实际年龄每大10岁,患痴呆的可能性上升近40%;估算脑龄低于实际年龄者风险更低。
语言模型可帮助认知科学整合碎片化文献、形式化言语理论、识别构念与测量之间的重叠、跨任务生成预测,并从自然数据中提取文化与生态结构。但这类应用也伴随过度简化、不透明、技能退化和偏差等风险。作者认为,只有审慎地用语言模型辅助而非取代人的能动性,它才可能推动认知科学走向更整合、更具累积性的研究。
社会科学研究者正使用大语言模型生成“硅样本”,即用来替代人类被试的合成数据集。文章指出,生成这类样本涉及模型选择、抽样等多项分析选择,由此带来的分析灵活性构成威胁。该文发表于 Advances in Methods and Practices in Psychological Science 第9卷第3期。
一项发表于 Current Directions in Psychological Science 的框架性文章,基于归因理论分析人们如何判断生成式 AI(GenAI)使用者,涵盖使用者对自身及他人的判断。文章指出,GenAI 正在改变人们工作、沟通与决策的方式,由此引发了关于其使用者如何被评判的独特问题。