跳到正文
原文
PsyArXiv 预印本·· 3 小时前AI 评分62

三个大模型对酒精使用障碍风险的判断与流行病学证据不一致

Evaluating Large Language Models on Clinical Risk Judgement: An Example from Alcohol Use Disorder

AI 导读

一项预印本研究检验了 GPT-5.5、LLaMA-2-70B 和 MEDITRON-70B 对酒精使用障碍(AUD)风险的判断是否与流行病学证据一致。三个模型完成四组配对比较实验,涉及 DSM-5 AUD 标准、人口学特征、标准与人口学特征组合以及叙事临床情境,并与 NESARC-III 得出的流行病学基准比较。

来源:PsyArXiv 预印本 · osf.io