中文

通过逐步偏好调优的多模态代理工具使用探索

计算机视觉与模式识别 2025-10-27 v4

摘要

多模态代理将控制器(例如视觉语言模型)与外部工具集成,已在解决复杂多模态任务方面展现出惊人的能力。现有的训练方法,无论是监督式微调还是强化学习,都依赖于大量的人工标注任务-答案对和工具轨迹。然而,对于复杂的多模态任务,这些标注在成本和实际性方面都不可行。本文提出了一种无需预收集数据即可进行多模态代理工具使用探索的方法,即SPORT,通过逐步偏好优化来完善工具使用的轨迹。我们的 方法使多模态代理能够通过自我探索和优化自主发现有效的工具使用策略,消除了人工标注的瓶颈。SPORT包含四个迭代组成部分:任务综合、步骤抽样、步骤验证和偏好调优。我们首先使用语言模型合成多模态任务。然后,我们引入一种新颖的轨迹探索方案,步骤抽样和步骤验证交替执行以解决合成任务。在步骤抽样中,代理尝试不同的工具并获取相应结果。在步骤验证中,我们采用验证器提供AI反馈,以构建逐步偏好数据。随后,使用偏好调优更新控制器以实现工具使用,生成SPOT代理。通过与真实环境交互,SPOT代理逐渐演化为更精细和更具能力的系统。评估表明,在GTA和GAIA基准测试中,SPOT代理分别实现了6.41%和3.64%的改进,凸显了该方法在泛化性和有效性方面的引入。项目页面为https://SPORT-Agents.github.io。

关键词

引用

@article{arxiv.2504.21561,
  title  = {Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning},
  author = {Pengxiang Li and Zhi Gao and Bofei Zhang and Yapeng Mi and Xiaojian Ma and Chenrui Shi and Tao Yuan and Yuwei Wu and Yunde Jia and Song-Chun Zhu and Qing Li},
  journal= {arXiv preprint arXiv:2504.21561},
  year   = {2025}
}

备注

24 pages