中文

一次迟到:面向多轮对话中隐藏恶意意图的响应感知防御

计算与语言 2026-05-13 v2 人工智能 密码学与安全

摘要

多轮对话中的隐藏恶意意图正成为部署大型语言模型 (LLM) 的日益增长威胁。与此不同,攻击者不再在单个提示中暴露有害目标,而是越来越能够跨越多个看似良性的轮次分发其意图。近期研究表明,即便是拥有先进警戒措施的现代商业模型,在安全对齐和外部警戒措施取得进展后,仍然对此类攻击保持脆弱。本文通过检测在提供候选响应后,累积的交互是否足以启用恶意行为,从而解决此挑战——即识别恶意行为启用闭合点的精确轮次级别干预,同时避免对良性探索性对话进行过早拒绝。为进一步支持训练和评估,我们构建了多轮意图数据集 (MTID),其中包含分支攻击 rollout、匹配的良性硬负样本以及最早恶意行为启用轮次的注释。我们表明 MTID 有助于实现轮次级别的监控器 TurnGate——它在恶意意图检测方面显著优于现有基线,同时保持较低的过度拒绝率。TurnGate 还在不同领域、攻击管线和目标模型之间具有良好的概括性。我们的代码可在 https://github.com/Graph-COM/TurnGate 提供。

关键词

引用

@article{arxiv.2605.05630,
  title  = {One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue},
  author = {Xinjie Shen and Rongzhe Wei and Peizhi Niu and Haoyu Wang and Ruihan Wu and Eli Chien and Bo Li and Pin-Yu Chen and Pan Li},
  journal= {arXiv preprint arXiv:2605.05630},
  year   = {2026}
}

备注

Project Website: https://turn-gate.github.io/