中文

强化学习对齐的泛化极限

机器学习 2026-04-06 v1 人工智能

摘要

大型语言模型(LLM)的安全性依赖于如强化学习从人类反馈(RLHF)等对齐技术。然而,最近的理论分析表明,基于强化学习的训练并未获取新能力,而仅仅是重新分配现有能力的利用概率。本研究提出针对OpenAI gpt-oss-20b的“复合型攻击”,利用对齐的泛化失效。这一方法结合多个攻击技术——每个技术单独都有防御——以饱和指令层次维护过程。我们的评估显示,攻击成功率(ASR)从仅使用单个方法时的14.3%增加到使用组合方法时的71.4%。这些结果为该假设提供了实证证据,即安全训练的泛化范围不如模型能力广泛,凸显了使用复合攻击情景进行多维度安全评估的必要性。

关键词

引用

@article{arxiv.2604.02652,
  title  = {Generalization Limits of Reinforcement Learning Alignment},
  author = {Haruhi Shida and Koo Imai and Keigo Kansa},
  journal= {arXiv preprint arXiv:2604.02652},
  year   = {2026}
}

备注

7 pages, 2 figures, 2 tables, accepted at JSAI 2026