Refer-Agent:基于推理与反思的协作多智能体系统用于指涉视频对象分割
计算机视觉与模式识别
2026-02-09 v2
摘要
指涉视频对象分割(RVOS)旨在基于文本查询对视频中的对象进行分割。当前方法主要依赖大规模监督微调(SFT)的多模态大语言模型(MLLMs)。然而,这种范式受数据依赖性强、难以应对 MLLMs 快速演化的限制。虽然最近的零样本方法提供了灵活的替代方案,但其性能仍显著落后于基于 SFT 的方法,due to workflow 设计单调。为解决这些限制,我们提出了 Refer-Agent,一个具备交替推理-反思机制的协作多智能体系统。该系统将 RVOS 分解为逐步推理过程。在推理过程中,我们引入粗到细帧选择策略以确保帧的多样性和文本相关性,同时提出动态焦点布局(Dynamic Focus Layout),使智能体的视觉焦点具有自适应调整能力。此外,我们提出了链式反思机制(Chain-of-Reflection),该机制采用问答者-响应者配对生成自反思链,使系统能够验证中间结果并为下一轮推理 refinement 提供反馈。大量实验在五个具有挑战性的基准数据集上表明,Refer-Agent 显著优于最先进的方法,包括基于 SFT 的模型和零样本方法。此外,Refer-Agent 灵活且能够在无需额外微调的情况下快速集成新的 MLLMs。代码将在 https://github.com/iSEE-Laboratory/Refer-Agent 上发布。
引用
@article{arxiv.2602.03595,
title = {Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation},
author = {Haichao Jiang and Tianming Liang and Wei-Shi Zheng and Jian-Fang Hu},
journal= {arXiv preprint arXiv:2602.03595},
year = {2026}
}