中文

面向压缩多轮对话训练防御性 M2S 警戒模型

计算与语言 2026-01-05 v1 人工智能

摘要

警戒模型是确保大型语言模型 (LLM) 部署安全的关键,但处理完整的多轮对话历史会产生显著的计算成本。我们提出了 Defensive M2S 训练范式,通过对多轮转单轮 (M2S) 压缩对话进行微调警戒模型,而非完整的对话历史。我们提供的形式化复杂度分析表明,M2S 将 n 轮对话的训练成本从 O(n2)O(n^2) 降低至 O(n)O(n)。经验上,在我们的数据集 (779 个样本,平均 10.6 轮) 上,M2S 仅需 169K token,而多轮基线则需 15.7M token —— 降低 93 倍。我们在 SafeDialBench 上评估了 Defensive M2S,该基准是综合性的多轮越狱基准测试。我们的 最佳配置,即使用 hyphenize 压缩的 Qwen3Guard,实现 93.8% 攻击检测召回率,同时将推理 token 减少 94.6%(从每次对话 3,231 个 token 降至 173 个 token)。这代表了比基线高出 38.9 个百分点的改进,同时显著降低了训练和推理成本。我们的发现表明,M2S 压缩可作为警戒部署的有效效率技术,使可对长多轮对话进行可扩展的安全筛选。

关键词

引用

@article{arxiv.2601.00454,
  title  = {Defensive M2S: Training Guardrail Models on Compressed Multi-turn Conversations},
  author = {Hyunjun Kim},
  journal= {arXiv preprint arXiv:2601.00454},
  year   = {2026}
}