中文

基于人类反馈的可解释强化学习用于改善对齐

机器学习 2025-12-17 v1

摘要

在日常生活中,人们常通过寻找不满意结果的原因并进行纠正来改善结果。在本文中,我们研究了将这种人类改进策略应用于改进由人类反馈训练的强化学习(RLHF)以实现语言模型(LM)对齐。特别是,文献中发现,尽管使用 RLHF 调谐的 LM 仍会输出不满意的响应。本文提出了一种方法,通过纠正导致这些不满意响应的原因来改进这些响应。该方法包含两个部分:第一部分提出了一种后置解释方法,用于解释不满意响应是如何生成的,通过识别导致该响应的训练数据。我们将该问题形式化为一个受约束的组合优化问题,其中目标是找到一组与该提示-响应对在特征表示空间中最接近的训练数据,约束条件为该提示-响应对可被分解为该训练数据集合在特征空间中的凸组合。我们提出了一种高效的迭代数据选择算法来求解该问题。第二部分提出了一种遗忘方法,通过遗忘导致这些不满意响应的训练数据,同时不会显著降低对其他提示的满意响应。实验结果表明,我们的算法能够改进 RLHF。

关键词

引用

@article{arxiv.2512.13837,
  title  = {Explainable reinforcement learning from human feedback to improve alignment},
  author = {Shicheng Liu and Siyuan Xu and Wenjie Qiu and Hangfan Zhang and Minghui Zhu},
  journal= {arXiv preprint arXiv:2512.13837},
  year   = {2025}
}