中文

VickreyFeedback:强化学习从人类反馈中的成本效益数据构建

机器学习 2024-12-13 v2 人工智能 计算与语言 计算机科学与博弈论 综合经济学 经济学

摘要

本文聚焦于强化学习从人类反馈(RLHF)的成本效益问题。RLHF 通过大型语言模型(LLM)输出的人类偏好数据集,来将人类期望内化于 LLM 中。尽管偏好标注伴随货币化成本,但迄今为止尚未考虑偏好数据集的经济效用。更糟糕的是,鉴于偏好数据集中存在复杂的非传递或循环关系,现有微调 LLM 的算法仍远未能捕捉到完整的偏好。这在生产环境中造成严重的成本效益问题,因为偏好数据会随时间累积。本文将 LLM 的微调视为一种货币化经济,引入拍卖机制以提高偏好数据收集的效率。我们表明,引入拍卖机制在保持满意模型性能的前提下,对于增强 RLHF 的成本效益发挥了关键作用。实验结果表明,我们提出的基于拍卖的协议对专注于高质量反馈的 LLM 微调具有成本效益。

关键词

引用

@article{arxiv.2409.18417,
  title  = {VickreyFeedback: Cost-efficient Data Construction for Reinforcement Learning from Human Feedback},
  author = {Guoxi Zhang and Jiuding Duan},
  journal= {arXiv preprint arXiv:2409.18417},
  year   = {2024}
}

备注

16 pages, 5 figures