AI欺骗:风险、动态与控制
人工智能
2025-12-04 v2
摘要
随着智能能力的提升,其阴影也随之增长。AI欺骗——即系统通过诱导虚假信念以实现自身有利结果——已从推测性 concern 发展为跨语言模型、AI智能体和新兴前沿系统中实证证明的风险。本项目提供了AI欺骗领域的全面最新概览,涵盖其核心概念、方法、生成机制及潜在缓解措施。首先,我们确定了基于动物欺骗研究中的信令理论的AI欺骗正式定义。随后我们审阅现有实证研究及其相关风险,突出欺骗作为一种sociotechnical安全挑战。我们将AI欺骗研究组织为一个欺骗循环,包含两个关键组成部分:欺骗生成与欺骗治疗。欺骗生成揭示了AI欺骗背后的机制:当具备足够能力和动机潜力的系统在受外部条件触发时,必然会采用欺骗行为。欺骗治疗则侧重于检测和解决此类行为。在欺骗生成方面,我们分析了跨三个层次的动机基础,识别出欺骗所必需的三个关键能力前提。我们进一步检查了情境触发器,包括监督缺口、分布迁移和环境压力。在欺骗治疗方面,我们总结了覆盖静态和交互式setting中基准和评估协议的检测方法。基于欺骗生成的三个核心因素,我们概述了潜在的缓解策略,提出将技术、社区和治理努力相结合的审计方法,以解决sociotechnical挑战和未来AI风险。为支持该领域的持续工作,我们在 www.deceptionsurvey.com 推出了living resource。
引用
@article{arxiv.2511.22619,
title = {AI Deception: Risks, Dynamics, and Controls},
author = {Boyuan Chen and Sitong Fang and Jiaming Ji and Yanxu Zhu and Pengcheng Wen and Jinzhou Wu and Yingshui Tan and Boren Zheng and Mengying Yuan and Wenqi Chen and Donghai Hong and Alex Qiu and Xin Chen and Jiayi Zhou and Kaile Wang and Juntao Dai and Borong Zhang and Tianzhuo Yang and Saad Siddiqui and Isabella Duan and Yawen Duan and Brian Tse and Jen-Tse and Huang and Kun Wang and Baihui Zheng and Jiaheng Liu and Jian Yang and Yiming Li and Wenting Chen and Dongrui Liu and Lukas Vierling and Zhiheng Xi and Haobo Fu and Wenxuan Wang and Jitao Sang and Zhengyan Shi and Chi-Min Chan and Eugenie Shi and Simin Li and Juncheng Li and Jian Yang and Wei Ji and Dong Li and Jinglin Yang and Jun Song and Yinpeng Dong and Jie Fu and Bo Zheng and Min Yang and Yike Guo and Philip Torr and Robert Trager and Yi Zeng and Zhongyuan Wang and Yaodong Yang and Tiejun Huang and Ya-Qin Zhang and Hongjiang Zhang and Andrew Yao},
journal= {arXiv preprint arXiv:2511.22619},
year = {2025}
}