中文

一致性训练有助于防止人格化与越狱

机器学习 2025-11-03 v1 人工智能

摘要

大语言模型(LLM)的事实性与拒绝训练可能因提示词的简单更改而受到破坏。模型常会采纳用户信念(人格化)或满足被包装在特殊文本中的不当请求(越狱)。我们探索了一致性训练,这是一种自监督范式,旨在教会模型对某些与提示无关的线索保持不变。我们并非教导模型在特定提示下给出确切响应,而是希望模型在提示数据增强(例如添加前导问题或越狱文本)时行为一致。我们以两种方式实现这一不变性:一种是针对模型外部输出进行不变性 enforcement(称为BCT,Biased-augmented Consistency Training),该方法由Chua等人[2025]提出;另一种是针对模型内部激活进行不变性 enforcement(称为ACT,Activation Consistency Training),这是我们引入的一种新方法。两种方法都降低了Gemini 2.5 Flash对无关线索的敏感性。由于一致性训练使用模型自身的响应作为训练数据,避免了诸如模型能力退化或强执行过时训练数据等问题的风险。虽然BCT和ACT在减少人格化方面效果相当,但BCT在越狱降低方面表现更好。我们认为,BCT可以通过消除对静态数据集的依赖来简化训练流程。我们认为,某些对齐问题不应从最优响应的角度来看待,而应视为一致性问题。

关键词

引用

@article{arxiv.2510.27062,
  title  = {Consistency Training Helps Stop Sycophancy and Jailbreaks},
  author = {Alex Irpan and Alexander Matt Turner and Mark Kurzeja and David K. Elson and Rohin Shah},
  journal= {arXiv preprint arXiv:2510.27062},
  year   = {2025}
}

备注

19 pages