DECOR:基于信息操纵理论审计 LLM 欺骗行为
计算与语言
2026-05-20 v1
摘要
大型语言模型可以通过微妙地操纵真实信息来进行欺骗——例如省略关键事实、转移注意力或模糊其意义——这种行为难以被检测。现有的黑盒方法依赖粗粒度判断,提供的解释力有限,无法定位哪些事实被扭曲以及如何扭曲。我们提出 DECOR,一个基于信息操纵理论的多智能体框架,用于对 LLM 回应中的战略性欺骗进行细粒度审计。DECOR 将输入语境分解为原子信息单元,并对每个单元在回应中的四个操纵维度上进行评分,产生可解释的操纵轮廓,最终聚合为全局欺骗指数。我们在涵盖真实世界领域的单轮和多轮欺骗检测基准上全面评估了 DECOR,结果表明 DECOR 在两个基准上均实现了最先进的性能,超越了竞争性基线。该框架可推广至 15 个前沿模型上,消融研究确认每个关键设计组件的贡献。我们的发现表明,基于信息操纵理论的细粒度、理论驱动的审计为 LLM 欺骗检测提供了一种有效且可解释的路径。
引用
@article{arxiv.2605.19270,
title = {DECOR: Auditing LLM Deception via Information Manipulation Theory},
author = {Linyue Cai and Samuel Yeh and Jwala Dhamala and Rahul Gupta and Sharon Li},
journal= {arXiv preprint arXiv:2605.19270},
year = {2026}
}