通过人类注视建模增强强化学习从人类反馈
机器学习
2025-07-17 v2
摘要
强化学习从人类反馈(RLHF)能够将语言模型与人类偏好对齐,但计算成本高昂。我们探讨两种利用人类注视建模来增强RLHF的方法:(1)注视感知奖励模型;(2)基于注视的稀疏奖励在token级别的分布。我们的实验表明,注视感知的RLHF在保持或略微提升性能的同时实现了更快的收敛,从而在策略优化期间降低了计算成本。这些结果表明,人类注视是政策优化中一个宝贵且被低估的信号,指向了提高RLHF效率的有前景的方向。
引用
@article{arxiv.2507.09016,
title = {Enhancing RLHF with Human Gaze Modeling},
author = {Karim Galliamov and Ivan Titov and Ilya Pershin},
journal= {arXiv preprint arXiv:2507.09016},
year = {2025}
}