中文

daVinci-Agency:高效获取长时程代理数据

机器学习 2026-02-05 v2 人工智能 软件工程

摘要

虽然大型语言模型(LLM)在短期任务中表现出色,但将其扩展到长时程代理工作流程仍面临挑战。核心瓶颈在于稀缺的训练数据,这些数据能够捕捉到真实的长程依赖结构和跨阶段的演化动力学——现有的合成方法要么局限于受模型分布约束的单一特征场景,要么造成昂贵的人工标注成本,无法提供可扩展且高质量的监督信号。我们通过将数据合成重新概念化为现实世界软件演化的视角来解决这一问题。我们的关键洞察是:拉取请求(PR)序列天然地包含了长时程学习的监督信号。它们将复杂目标分解为可验证的提交单元,保持跨迭代的功能一致性,并通过bug修复历史编码出真实的细化模式。基于此,我们提出了daVinci-Agency,通过三种相互交织的机制系统性地从链式PR中挖掘结构化监督:(1)通过持续提交实现渐进式任务分解,(2)通过统一的功能目标实现长期一致性,(3)从真实的bug修复轨迹中实现可验证的细化。不同于将每个步骤独立处理的合成轨迹,daVinci-Agency的PR驱动结构天然地保留了教授持续目标导向行为所必需的因果依赖关系和迭代细化,并能够自然地与项目级别的完整周期任务建模相吻合。 resulting trajectories are substantial--averaging 85k tokens and 116 tool calls--yet remarkably data-efficient: fine-tuning GLM-4.6 on 239 daVinci-Agency samples yields broad improvements across benchmarks, notably achieving a 47% relative gain on Toolathlon. Beyond benchmark performance, our analysis confirms...

关键词

引用

@article{arxiv.2602.02619,
  title  = {daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently},
  author = {Mohan Jiang and Dayuan Fu and Junhao Shi and Ji Zeng and Weiye Si and Keyu Li and Xuefeng Li and Yang Xiao and Wenjie Li and Dequan Wang and Pengfei Liu},
  journal= {arXiv preprint arXiv:2602.02619},
  year   = {2026}
}