模拟陪审团决策中对算法建议的易感性:警告AI可能出错可减少其影响
两项模拟陪审团实验发现,被试的判断会随算法建议的方向偏移,即使该建议与已呈现的证据相冲突。Experiment 2 重复了这一结果,并显示提前警告参与者AI可能出错和存在偏见可降低算法影响,尤其在算法建议有罪而证词显示无罪时。研究提示需关注算法建议对法律决策的影响,以及如何减少对AI建议的过度信任。
两项模拟陪审团实验发现,被试的判断会随算法建议的方向偏移,即使该建议与已呈现的证据相冲突。Experiment 2 重复了这一结果,并显示提前警告参与者AI可能出错和存在偏见可降低算法影响,尤其在算法建议有罪而证词显示无罪时。研究提示需关注算法建议对法律决策的影响,以及如何减少对AI建议的过度信任。
一项发表于 PNAS 的研究用深度学习模型,基于 14,748 名 19 至 100 岁认知健康成人的 MRI 训练出体素级局部脑龄地图,并在 1,985 人的阿尔茨海默病神经影像学倡议样本上测试。
一项发表于 Cell 的研究绘制出小鼠全脑血清素神经元连接图谱,首次在脊椎动物中获得血清素系统的“项目组图谱”,识别出五类靶向功能相关脑区的投射群。研究结合病毒遗传学示踪与全脑成像,发现这些投射群在基因表达和影响行为上各有特征,部分行为结果在雌雄小鼠间存在差异。
一项发表于 Neurology 的研究利用挪威 Trøndelag 健康研究(HUNT)的数据,用机器学习模型在不使用任何头痛信息的前提下识别偏头痛患者,准确率较高,最关键的预测因素包括年龄、生理性别、颈部疼痛和恶心。
日本一项针对1024名Kessler-6≥13且伴自杀意念的18–69岁成人的横断面网络调查发现,仅19.5%愿意使用AI聊天支持,21.3%愿意使用人工聊天支持,74.8%对两种方式均无使用意愿。该预印本已发表于 Suicide Policy Research。
研究提出仅通过自然语言提示、使用消费级大语言模型订阅开发的通用实验智能体AGEA,在未针对任何具体任务训练的情况下完成了七个托管平台上的26项在线行为实验,并自行推断每项任务的结构。
推荐理由:研究用通用智能体完成26项在线行为实验,提示线上被试真实性假设正面临可迁移的挑战。
两项研究考察了未被提示说服的AI聊天机器人对话如何影响政治态度。第一项对英国成年人(N = 2,137)的配额匹配调查显示,AI的政治用途已相当普遍,其输出通常被视为政治中立;第二项预注册随机对照试验(N = 2,081)中,参与者与未被提示说服的LLM谈论政治人物或政策,结果谈论政治人物提高了对其好感度,谈论政策则小幅降低支持,对话个性化未放大这些效应。该预印本尚未经同行评审。
一项预印本研究用 Body Mapping 比较了人类与生成式 AI 对时间、长度、数量、物理大小四个概念维度的身体组织方式。实验一中,人类被试对“未来”“长”“更多”“大”报告出显著的身体活动增强,其中“未来”“更多”“大”主要关联头部与躯干中部,“长”则呈四肢中心模式。
一项发表于《Learning and Instruction》的研究考察了教师情感支持、提问开放性与学生口语参与的关系,以及积极情绪在AI观察的STEM与非STEM课堂不同阶段中的作用。研究由Yayun Gong等人开展,采用AI课堂观察方法,覆盖STEM与非STEM两类课堂。
中山大学周晓宇、褚宇轩、张立伟和梁建平的四项实验发现,当睡眠节律与作息安排错位(社交时差)时,人们更倾向于让AI而非人类来评价自己。
一项混合方法研究探讨了生成式AI支持的写作项目对小学生写作动机、投入与表现的影响。该研究发表于 Learning and Instruction 第106卷,作者为 Qi Lu、Minhong Wang、Yuan Yao、Xinhua Zhu、Longhai Xiao 与 Hongbiao Yin。
研究通过两项经典经济博弈的规范 elicitation,比较人们对替自己行事的人类与大语言模型是否适用不同规范。作者为 Paweł Niszczota 与 Elia Antoniou,论文发表于 Journal of Experimental Social Psychology 第 127 卷(2026 年 11 月)。
一项发表于 Behaviour Research and Therapy 的研究用可解释机器学习预测 MBSR(正念减压疗法)后的正念效果,作者为 Luis Javier Herrera 与 Pablo Roca。该研究旨在推动"精准正念",即识别哪些人更可能从 MBSR 中获益。
一项发表于 Nature Human Behaviour 的研究发现,在在线请愿平台引入 AI 后,请愿文本的产出发生变化,但请愿结果并未改变。研究采用双重差分等方法分析平台数据,并引用生成式 AI 降低集体内容多样性的既有证据。
Franch 等人的研究显示,人海马神经元通过分布式、依赖语境的群体活动编码我们听到的词语含义,这种活动模式与大型语言模型的某些特征相似。该结果发表于 Nature Neuroscience,提示海马语义表征具有群体编码的特点。
一项横断面研究对 SPEAK-SAFE 研究中 110 次心理治疗会谈的转录文本进行分析,用 Qwen3-32B 大语言模型按改编的 C-SSRS 编码自杀相关话语,并构建加权有向类别转换网络。
赵等人利用高密度皮层脑电(ECoG)发现,想象言语与出声言语共享额顶叶的规划过程,而感觉运动编码具有模态特异性,并可稳健解码内部发音动态。该研究发表于 Nature Neuroscience,为言语运动想象的神经机制提供了直接颅内证据。
一项回顾性预测模型研究利用 Epic Cosmos 电子病历数据,纳入 322,879 名孤独症谱系障碍且共病心境或精神病性障碍的个体,仅用前一次就诊及之前可获得的信息预测下一次就诊时的自杀未遂。
一项发表于 Developmental Science 的计算建模研究提出“自我先验”(self-prior)密度模型,在基于自由能原理的主动推理框架下,让智能体仅凭内在过程自发产生目标导向行为。该机制通过最小化过去多模态感觉经验与当前观察之间的失配来生成行为参照,类似身体图式的习得与运用。在模拟环境中,智能体自发向触觉刺激(贴纸)伸手,无需外部奖励。
一项预注册研究将828名成人随机分配到数字单次干预(SSI)或等待名单,并用机器学习方法开发针对该干预的治疗匹配算法。作者指出,部分数字单次干预对抑郁似乎有效,至少对青少年如此,但并非所有人都能获益,因此尝试用算法识别更适合该干预的人群。研究使用的干预为Common(原文截断)。
推荐理由:研究用机器学习为数字单次干预匹配适合的抑郁患者,提示个性化分配可能改善心理治疗的可及性。
一项预印本研究用LLaMA和BERT的(伪)困惑度分析儿童期起病精神病(COP)患者(N=23,平均12.78岁)与对照(N=15,平均11.67岁)的访谈转录文本,发现LLaMA困惑度在COP组与年龄呈显著负相关、在对照组不显著,且病例状态可显著预测困惑度,BERT伪困惑度则无此关联。作者认为这反映了COP患者实时语义与句法规划的发育轨迹异常。
分析显示,使用生成式AI查询健康问题的美国大学生焦虑和抑郁筛查阳性几率更高。研究基于96,205名美国大学生的全国代表性样本,采用复杂抽样多变量logistic回归并控制人口学特征。
互动式说服任务显示,OpenAI 的推理模型 o3 在目标心理状态已知时说服表现优异,但在状态隐藏、需要主动询问或推断时仅相当于随机水平。研究包含三项实验,说服者需策略性披露信息,让目标在三个政策提案中做出选择,人类被试在两种条件下表现中等;在由人类扮演目标以及测量人类真实信念是否改变的两项实验中,o3 超过人类说服者,已知条件下差距显著。
推荐理由:研究用互动式说服任务对比大模型与人类的表现,提示静态问答基准未必反映真实的心智推断能力。
一项对MindApps.org数据库中865款心理健康应用的五年纵向生存分析发现,464款(53.6%)在2,142天的研究期内被下架。不同临床目标的应用生存期存在差异,戒烟类应用下架风险最高,睡眠类应用生存期最长;仅支持安卓而不兼容iOS是应用被下架最突出的特征,其下架风险是其他应用的2.32倍(Cox回归C-index=0.77,随机森林AUC=0.82)。
两项多来源多轮次调查显示,领导与AI协作通过提升团队反思维和团队角色宽度自我效能,进而改善团队绩效,领导年龄增强了这两条路径;团队角色超载的中介作用结果不一致。研究提示领导与AI协作对团队有益,年长领导在数字化时代可能更具优势。
一项并行嵌入式混合方法研究以 50 名咨询学生为对象,考察 ChatGPT 对咨询技能自我效能的支持作用。前后测双向混合设计方差分析显示交互效应显著,在应对挑战性来访者(尤其是建立关系)的效能感上效应量较大(partial η² = 0.185)。对学生反思的主题分析归纳出使用 ChatGPT-4o 练习咨询技能的 5 项积极体验与 6 项主要挑战。
两项发表于 Cell 和 Science 的研究发现,放射状胶质细胞的分化决策受两类信号调控:Cell 研究显示葡萄糖代谢中的磷酸戊糖途径可主动影响其生成的细胞类型,Science 研究则发现丘脑投射纤维通过物理接触促使干细胞产生更多兴奋性神经元,且该效应在携带 NRXN1 突变的孤独症相关模型中发生改变。
一项发表于 Science Advances 的研究提出,脑进化可能不是在新脑区之上叠加旧脑区,而是在有限脑空间里分配两种布线策略。研究者比较了182个物种的边缘系统与新皮层,发现边缘系统各区域往往同步变大或变小,而新皮层相应变小;用人工神经网络模拟时,偏好嗅觉的环境让分布式“条形码式”网络扩张、新皮层缩小,偏好视觉时则相反。作者认为,这一机制或可帮助构建所需训练数据和能耗更少的AI系统。
爱荷华大学团队让38名18至35岁被试学习颜色、面孔与场景的关联后更改配对规则,结合fMRI与计算模型发现,前顶叶皮层并非固定不变地与全脑通信,而是随决策阶段所需信息动态调整连接模式。研究者指出,该信息整合功能异常可能与ADHD和精神分裂症中难以根据情境变化调整行为有关。
研究用243篇真实和262篇编造的自传体故事测试语言测谎,让大语言模型把欺骗性陈述改写得更像真话。当改写与评判目标对齐时,人类判断(d = −0.07 和 d = −0.04)和机器学习判断(51% 准确率)都降到随机水平;未对齐时,人类的细节性启发式判断(d = 0.30 和 d = 0.36)与机器学习预测(63%–78%)仍显著高于随机。
推荐理由:研究用大语言模型改写谎言文本,显示人机测谎在攻击与目标对齐时都会降到随机水平,为语言测谎的可靠性提供了对抗性检验视角。
一项基于虚拟现实的研究设计了自我参照复杂试次协议(CTP),通过测量早期后部负波(EPN)区分有罪者与知情无辜者。有罪组在无关刺激与探针间的EPN波幅差异显著大于知情及不知情无辜组,区分有罪者与知情无辜者的AUC = 0.90,与不知情无辜者的AUC = 0.88。
一项由加州大学旧金山分校和贝斯以色列女执事医疗中心研究人员领导的研究,用机器学习模型结合睡眠脑电(EEG)中的13个微观特征估算“脑龄”,发现估算脑龄比实际年龄每大10岁,患痴呆的可能性上升近40%;估算脑龄低于实际年龄者风险更低。
一项基于荷兰要人警卫与监视体系内学术专家和从业者(含警察、宪兵、检察机关和反恐部门等)深度访谈的研究发现,AI在OSINT分析和LLM辅助评估等场景有应用前景,但训练模型所需数据的质量与可及性、以及人机交互在实战环境中的未知因素是突出挑战。研究还通过专家会议对访谈中识别出的挑战进行了排序。鉴于要人警卫与监视工作高风险、时间敏感的特性,AI落地实施较为复杂。
一项研究让 469 名被试阅读家庭内或家庭外性侵情境并评定罪行严重性与对恢复性司法的支持度,再与 Gemini、Grok 和 DeepSeek 生成的 120 条输出比较。人类与大语言模型都认为家庭内性侵更严重,但在结构化提示条件下,模型给出的恢复性司法支持度评分显著高于人类。人类中感知严重性完全中介了侵害情境与支持度的关系,模型中的中介仅为部分,且不同模型间存在显著差异。
推荐理由:研究对比了人类与三种大语言模型对性侵案件恢复性司法的判断,为理解幸存者求助 AI 时的信息偏差提供参照。
伊利诺伊大学厄巴纳-香槟分校团队在小鼠进行虚拟现实走廊导航并做知觉决策时,于初级躯体感觉皮层(S1)记录到与决策相关的神经活动,该区域还受高级脑区反馈环路调控,研究发表于 PNAS。这挑战了决策只在信息沿严格层级传至额叶皮层后才产生的传统观点,或为更节能的下一代 AI 架构提供启发。研究者强调该研究并未给出构建更优 AI 的蓝图,下一步将探究这些脑信号的时序及反馈环路的形成机制。
美国乔治城大学的研究发现,经过5至10周、超过3万次分类练习后,同一任务的主要脑活动从前额叶皮层转移到颞叶皮层,且转移越多,被试同时完成第二项任务的表现越好。研究用fMRI和EEG在被试训练前后各测量一次,作者认为这提示经验可以重塑神经回路、绕开额叶瓶颈,从而支持真正的多任务处理。该研究发表于Journal of Cognitive Neuroscience。
美国贝勒医学院团队在癫痫手术患者全身麻醉期间,用 Neuropixels 探针记录海马体数百个神经元的活动,发现大脑仍能识别意外音调并随时间提高识别能力,还能实时区分名词、动词和形容词,并在词语说出前预测即将出现的内容。研究发表于 Nature,作者提醒结果仅来自一种全身麻醉,未必适用于睡眠或昏迷等其他无意识状态,且只考察了单个脑区。
研究考察文化紧松度(社会规范被强制执行的程度)如何影响网络话语极化,发现强社会规范在特定条件下反而与话语分化有关。该研究发表于 Journal of Cross-Cultural Psychology 第57卷第7期,探讨了社会文化因素在网络极化中此前未被充分研究的角色。
研究开发了基于语言的AI评估工具,用于判断创伤后应激障碍(PTSD)的严重程度,并对其可重复性与效度进行序贯评估,同时完成模型预注册。作者指出,AI通过语言识别精神病理虽具潜力,但模型的可重复性仍是难题。该研究发表于 Clinical Psychological Science,尚属提前在线版本。
推荐理由:研究用患者语言训练AI评估PTSD严重程度,并做模型预注册与序贯验证,可供关注AI心理测量的研究者参考。
新加坡一所大学 409 名使用生成式 AI 完成学业任务的本科生中,披露意愿主要由关系与社会变量预测,感知到的同伴披露和与教师的相处舒适度是最强预测因子,道德推脱作用较弱。质性分析显示,不披露是对同伴规范和低教师解释信任的策略性适应,而非道德疏忽。研究基于 Bandura 社会认知理论,采用混合方法设计。