从幻觉到操纵:LLM 欺骗统一分类学与基准分析
计算机与社会
2026-04-07 v1
摘要
大型语言模型 (LLM) 产生系统性误导性输出,涵盖从虚构引用到对评估者的战略欺骗,但这些现象被社区分开研究,术语不兼容。我们提出一种统一分类学,沿三个互补维度组织:目标导向程度(从行为到战略欺骗)、欺骗对象、以及机制(制造、遗漏或实用主义扭曲)。将此分类学应用于 50 个现有基准后发现,每个基准均测试制造,然而实用主义扭曲、归因和能力自我认识方面严重不足,战略欺骗基准亟待发展。我们为开发者和监管者提供具体建议,包括针对未来工作在框架内定位的最小报告模板。
引用
@article{arxiv.2604.04788,
title = {From Hallucination to Scheming: A Unified Taxonomy and Benchmark Analysis for LLM Deception},
author = {Jerick Shi and Terry Jingcheng Zhang and Zhijing Jin and Vincent Conitzer},
journal= {arXiv preprint arXiv:2604.04788},
year = {2026}
}
备注
Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop