从逆向工程中获得的洞见:通过逆强化学习重构LLM训练目标
计算与语言
2025-10-07 v3
摘要
使用人类反馈强化学习(RLHF)训练的大型语言模型(LLMs)已展现出惊人的能力,但其底层奖励函数和决策过程仍不为人所知。这篇论文引入了一种新颖的方法,通过应用逆强化学习(IRL)来恢复其隐式奖励函数。我们对不同大小的毒性对齐LLMs进行实验,提取的奖励模型在预测人类偏好方面达到最高85%的准确率。我们的分析揭示了奖励函数不可识别性、模型大小与可解释性之间的关系,以及RLHF过程中潜在的陷阱。我们展示了IRL派生的奖励模型可用于微调新的LLMs,在毒性基准测试中实现相当或更好的性能。这项工作为理解和改进LLM对齐提供了新的视角,对负责任地开发和部署这些强大系统具有深远的意义。
引用
@article{arxiv.2410.12491,
title = {Insights from the Inverse: Reconstructing LLM Training Goals Through Inverse Reinforcement Learning},
author = {Jared Joselowitz and Ritam Majumdar and Arjun Jagota and Matthieu Bou and Nyal Patel and Satyapriya Krishna and Sonali Parbhoo},
journal= {arXiv preprint arXiv:2410.12491},
year = {2025}
}
备注
Published as a conference paper at COLM 2025