中文

视同AI:通过基于注视的响应奖励实现大型语言模型的人类对齐

计算与语言 2025-04-01 v3 人工智能 计算机视觉与模式识别 人机交互

摘要

自然语言处理(NLP)的进步催生了大型语言模型(LLM),如GPT、Llama、Claude和Gemini,它们在各种任务中表现出色,但需要大量的微调才能使其输出与人类期望对齐。一种广泛使用的实现这种对齐的方法是来自人类反馈的强化学习(RLHF),尽管取得了成功,但在准确建模人类偏好方面仍面临挑战。在本文中,我们介绍了GazeReward,一种新颖的框架,它将隐式反馈——特别是眼动追踪(ET)数据——整合到奖励模型(RM)中。此外,我们探讨了基于ET的特征如何提供对用户偏好的洞察。通过消融研究,我们使用不同的集成方法、LLM和ET生成器模型测试了我们的框架,证明我们的方法在已建立的人类偏好数据集上显著提高了RM的准确性。这项工作推进了关于优化AI与人类价值观对齐的持续讨论,探索了认知数据在塑造未来NLP研究中的潜力。

关键词

引用

@article{arxiv.2410.01532,
  title  = {Seeing Eye to AI: Human Alignment via Gaze-Based Response Rewards for Large Language Models},
  author = {Angela Lopez-Cardona and Carlos Segura and Alexandros Karatzoglou and Sergi Abadal and Ioannis Arapakis},
  journal= {arXiv preprint arXiv:2410.01532},
  year   = {2025}
}

备注

This paper has been accepted to ICLR 2025