中文

MetaCaptioner:面向通用视觉描述的开源工具套件

计算机视觉与模式识别 2025-10-17 v3

摘要

通用视觉描述任务超越简单的外观描述,要求将一系列视觉线索整合到描述中,并处理各种视觉领域。该任务的当前开源模型与商业模型之间存在较大性能差距,这限制了诸多应用,如数据合成。为弥合这一差距,本文提出一种新颖的多智能体协作工作流程 CapFlow。CapFlow 首次展示,凭借开源模型即可在各种领域实现与 GPT-4.1 相当的描述质量,同时将成本降低 89.5%。通过将 CapFlow 作为数据合成器,我们大规模地从图像和视频领域生成高质量视觉描述,并获得一个通用视觉描述器,称为 MetaCaptioner。通过大量实验,我们展示 MetaCaptioner 不仅在描述能力上与商业模型持平,还在开源社区中达到多模态性能的顶尖水平。我们希望 CapFlow 和 MetaCaptioner 能通过提供一种强大且高性价比的视觉描述解决方案,为未来的多模态研究带来利益。

关键词

引用

@article{arxiv.2510.12126,
  title  = {MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites},
  author = {Zhenxin Lei and Zhangwei Gao and Changyao Tian and Erfei Cui and Guanzhou Chen and Danni Yang and Yuchen Duan and Zhaokai Wang and Wenhao Li and Weiyun Wang and Xiangyu Zhao and Jiayi Ji and Yu Qiao and Wenhai Wang and Gen Luo},
  journal= {arXiv preprint arXiv:2510.12126},
  year   = {2025}
}