思想纯度:面向链路思考攻击的防御框架
机器学习
2026-02-13 v3 人工智能
计算工程、金融与科学
密码学与安全
摘要
大规模推理模型 (LRMs) 利用链路思考 (Chain-of-Thought, CoT) 推理以解决复杂任务,但这种显式推理过程引入了一个关键漏洞:对思考链本身的对抗性操控,称为链路思考攻击 (Chain-of-Thought Attacks, CoTA)。此类攻击会 subtly 损坏推理路径,从而产生错误输出,挑战性地迫使常规防御措施在安全性和实用性之间进行权衡。为此,我们提出了思想纯度 (Thought Purity, TP),一种防御框架,TP 采用主动推理恢复而非被动拒绝的策略。TP 将整合安全感知数据管道与强化学习,采用双奖励机制教导模型动态识别并隔离恶意逻辑,同时保留正确的推理。多项实验表明,TP 在多个模型家族上显著降低了 CoTA 的攻击成功率,同时保持或提升了模型在良性任务上的性能。
引用
@article{arxiv.2507.12314,
title = {Thought Purity: A Defense Framework For Chain-of-Thought Attack},
author = {Zihao Xue and Zhen Bi and Long Ma and Zhenlin Hu and Yan Wang and Xueshu Chen and Zhenfang Liu and Kang Zhao and Jie Xiao and Jungang Lou},
journal= {arXiv preprint arXiv:2507.12314},
year = {2026}
}