中文

HelpSteer3:人类标注的反馈与编辑数据以赋能开放式通用领域任务的推理时扩展

计算与语言 2025-06-02 v2 人工智能 机器学习

摘要

推理时扩展对 OpenAI o1 和 DeepSeek R1 等近期模型的成功至关重要。然而,用于训练推理时扩展模型的技术通常要求任务具有可验证的答案,这限制了其在数学、编码和逻辑推理等领域的应用。本文从人类如何进行首次尝试、向他人寻求详细反馈并根据反馈进行改进的跨广泛开放式事业过程中获得灵感。为此,本文收集了 HelpSteer3 数据,用于训练专用的反馈模型和编辑模型,使其能够为开放式通用领域任务执行推理时扩展。在本设置中,一个模型生成初始响应,由第二个模型提供反馈,然后由第三个模型利用反馈编辑响应。本文表明,通过扩展初始响应草稿数量、有效反馈和编辑响应的数量,Arena Hard 上的性能(该基准强预测 Chatbot Arena Elo)可以得到提升。在最优扩展下,本文基于 Llama 3 家族 70B 模型的设置在 Arena Hard 上达到了 92.7 的最先进性能(截至 2025 年 3 月 5 日),超越了 OpenAI o1-preview-2024-09-12 的 90.4 和 DeepSeek R1 的 92.3。

关键词

引用

@article{arxiv.2503.04378,
  title  = {HelpSteer3: Human-Annotated Feedback and Edit Data to Empower Inference-Time Scaling in Open-Ended General-Domain Tasks},
  author = {Zhilin Wang and Jiaqi Zeng and Olivier Delalleau and Daniel Egert and Ellie Evans and Hoo-Chang Shin and Felipe Soares and Yi Dong and Oleksii Kuchaiev},
  journal= {arXiv preprint arXiv:2503.04378},
  year   = {2025}
}

备注

23 pages, 2 figures, Accepted to ACL 2025 Main