Inverse-Q*:无需偏好数据即可对齐大语言模型的令牌级强化学习
计算与语言
2024-08-30 v2
摘要
基于人类反馈的强化学习已被证明能有效使大语言模型与人类意图对齐,但它通常依赖于复杂的方法论,如近端策略优化,这些方法需要大量的超参数调优,并在样本效率和稳定性方面带来挑战。在本文中,我们介绍了Inverse-Q*,一个创新的框架,它通过优化令牌级强化学习超越了传统的强化学习方法,无需额外的奖励或价值模型。Inverse-Q*利用了直接偏好优化技术,但通过直接从模型响应中估计条件最优策略来扩展它,从而促进更细粒度和更灵活的策略塑造。我们的方法减少了对人工标注和外部监督的依赖,使其特别适用于低资源环境。我们提供了广泛的实验结果,表明Inverse-Q*在收敛速度和模型响应与人类偏好对齐方面不仅匹配,而且可能超过近端策略优化的有效性。我们的发现表明,Inverse-Q*为传统的基于人类反馈的强化学习方法提供了一种实用且鲁棒的替代方案,为更高效和适应性更强的模型训练方法铺平了道路。
引用
@article{arxiv.2408.14874,
title = {Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data},
author = {Han Xia and Songyang Gao and Qiming Ge and Zhiheng Xi and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2408.14874},
year = {2024}
}