FINECAPTION: 面向任意颗粒度的组合图像描述
计算机视觉与模式识别
2024-11-26 v1
摘要
大型视觉语言模型(Vision-Language Models, VLMs)的出现显著推动了多模态任务的发展,使其能够在图像描述、视觉问答和跨模态检索等各种应用中进行更精细且精准的推理。尽管具备优越的能力,视觉语言模型仍在感知细粒度图像局部组合信息方面存在挑战。具体而言,它们在将分割掩码准确地对齐到相应语义,并精确描述所指区域的组合方面存在困难。然而,组合性——即理解和生成已知视觉与文本成分的新组合的能力——对于促进跨模态的连贯推理与理解至关重要。为此,我们提出了 FINECAPTION,一种能够识别任意掩码作为指代输入,并处理高分辨率图像以实现不同颗粒度下的组合图像描述的新型视觉语言模型。为支撑此任务,我们引入了 COMPOSITIONCAP 数据集,用于多粒度区域组合图像描述,提出了组合属性感知区域图像描述任务。实证结果表明,我们所提出的模型在多个最新视觉语言模型中均显示出色。此外,我们分析了当前视觉语言模型在识别用于组合区域图像描述的各种视觉提示方面的能力,揭示了视觉语言模型在设计和训练方面的改进空间。
引用
@article{arxiv.2411.15411,
title = {FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity},
author = {Hang Hua and Qing Liu and Lingzhi Zhang and Jing Shi and Zhifei Zhang and Yilin Wang and Jianming Zhang and Jiebo Luo},
journal= {arXiv preprint arXiv:2411.15411},
year = {2024}
}
备注
Preprint