中文

利用合成数据提高多跳推理

机器学习 2026-03-03 v1 人工智能 计算与语言

摘要

强化学习(RL)已被证明可显著提升大型语言模型(LLM)在数学、编码和多跳推理任务中的推理能力。然而,RL微调需要大量高质量可验证数据,常来自人工标注、来自前沿LLM生成或由LLM-based验证器打分。这三者都有明显局限:人工标注数据集规模小且昂贵,LLM生成的数据易产生幻觉且成本高昂,LLM-based验证器不准确且缓慢。本文我们探索一种更便宜的替代方案:在规则生成的合成数据上进行RL微调以提高多跳推理任务能力。我们发现,针对合成数据进行微调的LLM在流行的真实世界问答基准测试中表现显著更好,尽管合成数据仅包含虚构知识。在按问题难度分层的性能分析中,我们发现合成数据教会LLM组合知识——这是一种基本且可泛化的推理技能。我们的工作凸显规则生成的合成推理数据作为一种免费且可扩展资源,以提高LLM推理能力。

关键词

引用

@article{arxiv.2603.02091,
  title  = {Learning from Synthetic Data Improves Multi-hop Reasoning},
  author = {Anmol Kabra and Yilun Yin and Albert Gong and Kamilė Stankevičiūtė and Dongyoung Go and Johann Lee and Katie Z. Luo and Carla P. Gomes and Kilian Q. Weinberger},
  journal= {arXiv preprint arXiv:2603.02091},
  year   = {2026}
}

备注

Accepted to ICLR 2026