中文

通过影响函数理解人类反馈的影响

人工智能 2025-09-03 v3 人机交互 机器学习

摘要

在基于人类反馈的强化学习(RLHF)中,从人类反馈中学习合适的奖励模型以对齐大语言模型(LLMs)与人类意图至关重要。然而,人类反馈常常可能带有噪声、不一致或偏见,尤其是在评估复杂响应时。此类反馈可能导致奖励信号不对齐,从而在RLHF过程中引发意外的副作用。为应对这些挑战,我们探索使用影响函数来衡量人类反馈对奖励模型性能的影响。我们提出一种计算高效的近似方法,使得影响函数能够应用于基于LLM的奖励模型和大规模偏好数据集。我们的实验展示了影响函数的两个关键应用:(1)检测人类反馈数据集中的常见标注者偏见;(2)指导标注者优化其策略以更好地与专家反馈对齐。通过量化人类反馈的影响,我们相信影响函数能够增强反馈的可解释性,并为RLHF中的可扩展监督做出贡献,帮助标注者提供更准确和一致的反馈。源代码可在 https://github.com/mintaywon/IF_RLHF 获取。

关键词

引用

@article{arxiv.2501.05790,
  title  = {Understanding Impact of Human Feedback via Influence Functions},
  author = {Taywon Min and Haeone Lee and Yongchan Kwon and Kimin Lee},
  journal= {arXiv preprint arXiv:2501.05790},
  year   = {2025}
}

备注

Accepted at ACL 2025, Source code: https://github.com/mintaywon/IF_RLHF