一次迟到:面向多轮对话中隐藏恶意意图的响应感知防御
计算与语言
2026-05-13 v2 人工智能
密码学与安全
摘要
多轮对话中的隐藏恶意意图正成为部署大型语言模型 (LLM) 的日益增长威胁。与此不同,攻击者不再在单个提示中暴露有害目标,而是越来越能够跨越多个看似良性的轮次分发其意图。近期研究表明,即便是拥有先进警戒措施的现代商业模型,在安全对齐和外部警戒措施取得进展后,仍然对此类攻击保持脆弱。本文通过检测在提供候选响应后,累积的交互是否足以启用恶意行为,从而解决此挑战——即识别恶意行为启用闭合点的精确轮次级别干预,同时避免对良性探索性对话进行过早拒绝。为进一步支持训练和评估,我们构建了多轮意图数据集 (MTID),其中包含分支攻击 rollout、匹配的良性硬负样本以及最早恶意行为启用轮次的注释。我们表明 MTID 有助于实现轮次级别的监控器 TurnGate——它在恶意意图检测方面显著优于现有基线,同时保持较低的过度拒绝率。TurnGate 还在不同领域、攻击管线和目标模型之间具有良好的概括性。我们的代码可在 https://github.com/Graph-COM/TurnGate 提供。
引用
@article{arxiv.2605.05630,
title = {One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue},
author = {Xinjie Shen and Rongzhe Wei and Peizhi Niu and Haoyu Wang and Ruihan Wu and Eli Chien and Bo Li and Pin-Yu Chen and Pan Li},
journal= {arXiv preprint arXiv:2605.05630},
year = {2026}
}
备注
Project Website: https://turn-gate.github.io/