中文

通过人类注视建模增强强化学习从人类反馈

机器学习 2025-07-17 v2

摘要

强化学习从人类反馈(RLHF)能够将语言模型与人类偏好对齐,但计算成本高昂。我们探讨两种利用人类注视建模来增强RLHF的方法:(1)注视感知奖励模型;(2)基于注视的稀疏奖励在token级别的分布。我们的实验表明,注视感知的RLHF在保持或略微提升性能的同时实现了更快的收敛,从而在策略优化期间降低了计算成本。这些结果表明,人类注视是政策优化中一个宝贵且被低估的信号,指向了提高RLHF效率的有前景的方向。

关键词

引用

@article{arxiv.2507.09016,
  title  = {Enhancing RLHF with Human Gaze Modeling},
  author = {Karim Galliamov and Ivan Titov and Ilya Pershin},
  journal= {arXiv preprint arXiv:2507.09016},
  year   = {2025}
}