中文

增强视觉定位与泛化能力:一种面向视觉-语言模型的多任务循环训练方法

计算机视觉与模式识别 2024-04-29 v2

摘要

视觉定位(VG)在多模态视觉-语言模型中占据关键地位。在本研究中,我们提出 ViLaM,一个支持利用循环训练策略与丰富交互指令进行 VG 多任务的大型多模态模型。我们引入了指代表达生成(REG)与指代表达理解(REC)之间的循环训练。它增强了视觉位置与指代表达之间的一致性,并解决了高质量多任务 VG 数据集的需求。此外,得益于循环训练策略,我们模型中的 VG 多任务得到促进。REC 中的多任务涵盖从区域级到像素级的一系列粒度,包括指代 bbox 检测、指代关键点检测和指代图像分割。在 REG 中,指代区域分类确定目标的细粒度类别,而指代区域描述生成全面的描述。同时,所有任务参与联合训练,协同增强彼此并共同提升模型整体性能。进一步,借助大语言模型的能力,ViLaM 扩展了广泛的指令,从而显著增强其泛化与交互潜力。大量公开数据集证实了我们的模型在多变任务 VG 中的优越能力。此外,为验证其鲁棒泛化性,ViLaM 在开放集与少样本场景下得到验证。尤其在医疗领域,我们的模型展现出跨域鲁棒泛化能力。此外,我们贡献了一个 VG 数据集,特别是具有多任务的。为支持并鼓励专注于 VG 的社区,我们已公开该数据集与我们的代码:https://github.com/AnonymGiant/ViLaM。

关键词

引用

@article{arxiv.2311.12327,
  title  = {Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models},
  author = {Xiaoyu Yang and Lijian Xu and Hao Sun and Hongsheng Li and Shaoting Zhang},
  journal= {arXiv preprint arXiv:2311.12327},
  year   = {2024}
}

备注

22 pages