生成式AI中的对抗幻觉的模仿游戏——链条思考推理
人工智能
2026-05-01 v2 密码学与安全
计算机视觉与模式识别
摘要
作为人工智能的基石,机器感知正面临由对抗幻觉所构成的根本性威胁。这些对抗攻击主要表现为两种形式:演绎式幻觉,通过针对受害模型的通用决策逻辑精心设计特定刺激来干扰其决策过程;归纳式幻觉,通过特定刺激塑造受害模型的通用决策逻辑,在学习阶段植入后门,当触发特定刺激时导致异常行为。对抗幻觉的多面性迫切需要一个统一的防御框架,以解决各种攻击形式的漏洞。在本研究中,我们提出一种基于模仿游戏概念的幻觉消除范式。模仿游戏的核心是一个多模态生成式智能体,通过链条思考推理观察、内化并重构样本的语义本质,摆脱经典追求将样本还原到原始状态的束缚。作为概念验证,我们使用多模态生成式对话智能体进行实验模拟,并在各种攻击场景下评估该方法论。实验结果表明,所提出的框架在 diverse white-box 和 black-box 攻击场景中 consistently 中和 both 漏绎和归纳式对抗幻觉。
引用
@article{arxiv.2501.19143,
title = {Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI},
author = {Ching-Chun Chang and Fan-Yun Chen and Shih-Hong Gu and Kai Gao and Hanrui Wang and Isao Echizen},
journal= {arXiv preprint arXiv:2501.19143},
year = {2026}
}