中文

探讨 RLHF 方法论

机器学习 2024-10-03 v1 人工智能

摘要

本文探讨了根据人类偏好来对大语言模型进行对齐问题。我们讨论了训练偏好模型(模拟人类偏好)的特征,以及我们发现实现最佳结果所必需的方法和细节。我们还讨论了使用强化学习对大语言模型进行微调,并描述了我们所遭遇的挑战及其克服方式。此外,我们呈现了关于直接偏好优化(Direct Preference Optimization)方法的经验,该方法使我们能够在不创建单独的偏好模型的情况下,将大语言模型与人类偏好对齐。作为我们的贡献,我们提出了通过困惑度过滤收集偏好数据集的方法,这使得为特定语言模型创建此类数据集的过程变得更加容易和高效。

关键词

引用

@article{arxiv.2410.01789,
  title  = {Investigating on RLHF methodology},
  author = {Alexey Kutalev and Sergei Markoff},
  journal= {arXiv preprint arXiv:2410.01789},
  year   = {2024}
}

备注

23 pages, 6 figures, 6 tables