中文

面向 LLM 有害性缓解的生成方法:红旗标记

计算与语言 2025-10-08 v4 人工智能 密码学与安全 机器学习

摘要

许多大型语言模型(LLM)的安全后训练方法旨在修改模型行为,使其生成不安全答案时拒绝回答。然而,这类分布性迁移往往脆弱,会降低对理想任务的性能。为克服这些缺陷,我们提出通过向模型词表增设特殊红旗标记(red flag token),并训练模型在生成有害内容或即将生成有害内容时插入该标记。该方法使模型能够在表示中显式学习有害性概念,由于生成分布的轻微变化,对实用性几乎没有影响。此外,由于该标记嵌入模型词表,我们可以自然地利用 LLM 的泛化能力,例如情境学习(in-context learning,ICL)和对语言的外分布泛化(例如对日语等不正式支持的语言)。特别是,通过 ICL 本身,模型可以在推理时生成红旗标记后启动反思推理,从而引导响应远离有害 continuation,或在标记被错误触发时实现自我纠正。该方法与现有安全技术(如安全分类器或标准安全训练)是正交且互补的,并且由于不需人类或自动评委评估答案的无害性,评估起来更容易。

关键词

引用

@article{arxiv.2502.16366,
  title  = {A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens},
  author = {David Dobre and Mehrnaz Mofakhami and Sophie Xhonneux and Leo Schwinn and Gauthier Gidel},
  journal= {arXiv preprint arXiv:2502.16366},
  year   = {2025}
}

备注

15 pages, 6 figures