中文

DR Tulu:基于演化评分标准的强化学习用于深度研究

计算与语言 2026-05-18 v3 人工智能 机器学习

摘要

深度研究代理执行多步研究以产生长篇、经过充分归因的答案。然而,大多数开放式深度研究代理通过强化学习在可验证的短形式 QA 任务上进行训练,获得可验证的奖励,这并不适用于现实中的长形式任务。我们通过强化学习与演化评分标准(RLER)来解决这一问题,其中评分标准在训练过程中与策略模型共同演化。这样,评分标准能够融合来自搜索和对比模型响应中新发现的信息,从而实现更好的事实核查和更具辨别力的策略反馈。使用 RLER,我们开发了 Deep Research Tulu(DR Tulu-8B),是第一个直接为开放式、长篇深度研究训练的完全开放模型。在科学、医疗和通用领域的四个长篇深度研究基准测试中,DR Tulu 在已有开放式深度研究代理中显著优于表现(平均优于 Tongyi DR 15.6%),并与或接近专有深度研究代理(平均优于 OpenAI DR 0.7%),同时显著较小且每查询成本更低(每查询成本是 OpenAI DR 的 1000 倍)。

关键词

引用

@article{arxiv.2511.19399,
  title  = {DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research},
  author = {Rulin Shao and Akari Asai and Shannon Zejiang Shen and Hamish Ivison and Varsha Kishore and Jingming Zhuo and Xinran Zhao and Molly Park and Samuel G. Finlayson and David Sontag and Tyler Murray and Sewon Min and Pradeep Dasigi and Luca Soldaini and Faeze Brahman and Wen-tau Yih and Tongshuang Wu and Luke Zettlemoyer and Yoon Kim and Hannaneh Hajishirzi and Pang Wei Koh},
  journal= {arXiv preprint arXiv:2511.19399},
  year   = {2026}
}

备注

ICML 2026