中文

从失败中学习:通过面向失败的逆强化学习理解 LLM 对齐

机器学习 2026-01-21 v2 计算与语言

摘要

逆强化学习(IRL)是大语言模型(LLM)对齐的常用方法,但其提取的奖励信号仍是隐藏的,这给可解释性和安全性带来了挑战。现有方法尝试从 IRL 中提取这些潜在激励,但 treats all preference pairs equally,常常忽略最具信息量的信号:即被提取奖励模型误分类或几乎给出相同评分的例子,我们称之为\emph{失败}。我们引入一种新的\emph{面向失败}的 IRL 算法,聚焦于误分类或困难的例子,以恢复定义模型行为的潜在奖励。通过从这些失败中学习,我们的面向失败的 IRL 提取的奖励函数更能反映 RLHF 背后真实目标的激励。我们在应用于 LLM 去仇恨化任务时,证明面向失败的 IRL 在多个指标上优于现有 IRL 框架,无需外部分类器或监督。关键的是,面向失败的 IRL 提取的奖励更能捕捉 RLHF 期间所学习的真实激励,使其在更有效的 re-RLHF 训练中表现更好。这一工作表明,面向失败的 IRL 是一种稳健、可扩展的方法,可用于审计模型对齐并减少 IRL 过程中的歧义。

关键词

引用

@article{arxiv.2510.06092,
  title  = {Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL},
  author = {Nyal Patel and Matthieu Bou and Arjun Jagota and Satyapriya Krishna and Sonali Parbhoo},
  journal= {arXiv preprint arXiv:2510.06092},
  year   = {2026}
}

备注

Preprint