训练智能体而非专家:多轮视觉推理中异构专家的可调适方法
计算机视觉与模式识别
2026-05-29 v1
摘要
近期计算机视觉进步产生了广泛的强大专用模型,用于检测、分割、计数和其他视觉任务。然而,这些模型通常针对孤立任务公式进行优化,难以直接支持通用视觉智能,尤其是在需要复杂语言理解和稠密小目标感知的任务中。在本文中,我们提出VisHarness,一个可训练的视觉智能体,将高层感知、推理和决策与低层任务执行解耦。与训练针对特定视觉任务的模型不同,VisHarness学习如何利用一组精心设计的异构视觉专家。这一范式既保留了智能体的通用智能,又充分发挥了专用视觉模型在具体视觉任务中精确优势的优势。仅需轻量级训练,VisHarness即可学习通用可调适的视觉专家-运用策略,并通过与视觉专家模型之间的多轮交互,在各种复杂条件下解决常见基础视觉任务。为在活环境中实现高效的on-policy强化学习训练,我们引入了动态视觉记忆归档,该机制缓解了与视觉专家模型多轮交互导致的快速积累视觉token开销。实验在覆盖推理分割、通用指派分割、稠密小目标检测和指派计数的四个代表性基准上,表明VisHarness在现有通用模型中显著超越,并在与任务特定模型中实现竞争或优异性能。
引用
@article{arxiv.2605.29894,
title = {Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning},
author = {Yaowu Fan and Tao Han and Dazhao Du and Andy J. Ma and Jia Wan},
journal= {arXiv preprint arXiv:2605.29894},
year = {2026}
}