Legal and Criminological Psychology· Bennett Kleinberg,
Riccardo Loconte,
Bruno Verschuere·· 2026-08-11精选AI 评分62
目标对齐的对抗改写可让人工与机器测谎降至随机水平
Effective faking of verbal deception detection with target‐aligned adversarial attacks
AI 导读
研究用243篇真实和262篇编造的自传体故事测试语言测谎,让大语言模型把欺骗性陈述改写得更像真话。当改写与评判目标对齐时,人类判断(d = −0.07 和 d = −0.04)和机器学习判断(51% 准确率)都降到随机水平;未对齐时,人类的细节性启发式判断(d = 0.30 和 d = 0.36)与机器学习预测(63%–78%)仍显著高于随机。
推荐理由
研究用大语言模型改写谎言文本,显示人机测谎在攻击与目标对齐时都会降到随机水平,为语言测谎的可靠性提供了对抗性检验视角。
来源:Legal and Criminological Psychology · bpspsychub.onlinelibrary.wiley.com