中文

向数据中心RLHF靠拢:简单度量用于偏好数据集比较

人工智能 2024-09-17 v1 计算与语言 机器学习

摘要

将语言模型对齐人类偏好需要揭示这些偏好的数据。理想情况下,可以精心收集和量身定制偏好数据,以每个下游应用为目标。然而,实际中,仅有少数公开可用的偏好数据集用于训练奖励模型以进行强化学习从人类反馈(RLHF)。尽管新的偏好数据集正不断涌现,但目前尚无旨在衡量和比较这些数据集的努力。本文通过三个视角系统性地研究偏好数据集:规模、标签噪声和信息内容。我们为每个视角提出具体度量,并揭示数据集比较的不同轴向,以更好地理解偏好数据集。我们的工作是推进数据中心对齐方法的第一步,通过提供有助于训练效率和迭代数据收集的视角。

关键词

引用

@article{arxiv.2409.09603,
  title  = {Towards Data-Centric RLHF: Simple Metrics for Preference Dataset Comparison},
  author = {Judy Hanwen Shen and Archit Sharma and Jun Qin},
  journal= {arXiv preprint arXiv:2409.09603},
  year   = {2024}
}

备注

Working Paper