跳到正文
原文
Legal and Criminological Psychology· Bennett Kleinberg, Riccardo Loconte, Bruno Verschuere·· 2026-08-11精选AI 评分62

目标对齐的对抗改写可让人工与机器测谎降至随机水平

Effective faking of verbal deception detection with target‐aligned adversarial attacks

AI 导读

研究用243篇真实和262篇编造的自传体故事测试语言测谎,让大语言模型把欺骗性陈述改写得更像真话。当改写与评判目标对齐时,人类判断(d = −0.07 和 d = −0.04)和机器学习判断(51% 准确率)都降到随机水平;未对齐时,人类的细节性启发式判断(d = 0.30 和 d = 0.36)与机器学习预测(63%–78%)仍显著高于随机。

推荐理由

研究用大语言模型改写谎言文本,显示人机测谎在攻击与目标对齐时都会降到随机水平,为语言测谎的可靠性提供了对抗性检验视角。

来源:Legal and Criminological Psychology · bpspsychub.onlinelibrary.wiley.com