中文

Lyrics:通过语义感知视觉对象增强细粒度语言-视觉对齐与理解

计算与语言 2024-04-15 v2

摘要

大型视觉语言模型(LVLMs)在各种视觉语言对话场景中展现出了令人印象深刻的零样本能力。然而,由于缺乏细粒度的视觉目标检测,阻碍了模型对图像细节的理解,导致不可挽回的视觉幻觉和事实错误。在本文中,我们提出了 Lyrics,一种新颖的多模态预训练与指令微调范式,通过细粒度跨模态协作来自举视觉语言对齐。在 BLIP-2 的基础上,Lyrics 将从包含图像打标签、目标检测和语义分割模块的视觉精炼器中提取的局部视觉特征注入到 Querying Transformer 中,而在文本侧,语言输入配备了源自视觉精炼器的边界框和标签。我们进一步引入了两阶段训练方案,其中预训练阶段通过显式且全面的视觉语言对齐目标来弥合模态差距。在指令微调阶段,我们引入了语义感知视觉特征提取,这是一种使模型能够从具体视觉对象中提取信息特征的关键方法。我们的方法在跨各种视觉语言任务的 13 个数据集上取得了稳健的性能,并在 11 个基于场景的基准工具包中展现出了极具前景的多模态理解、感知和对话能力。

关键词

引用

@article{arxiv.2312.05278,
  title  = {Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects},
  author = {Junyu Lu and Dixiang Zhang and Songxin Zhang and Zejian Xie and Zhuoyang Song and Cong Lin and Jiaxing Zhang and Bingyi Jing and Pingjian Zhang},
  journal= {arXiv preprint arXiv:2312.05278},
  year   = {2024}
}