中文

GiVE:引导视觉编码器感知被忽视的信息

计算机视觉与模式识别 2025-03-24 v2 人工智能 多媒体

摘要

多模态大型语言模型已在文本到视频生成和视觉问答等应用中推动了 AI 的发展。这些模型依赖视觉编码器将非文本数据转换为向量,但当前的编码器要么缺乏语义对齐,要么忽略非显著对象。我们提出了引导视觉编码器感知被忽视信息 (GiVE) 方法。GiVE 通过 Attention-Guided Adapter (AG-Adapter) 模块和面向对象的视觉语义学习模块增强视觉表征。这些模块包含三个新损失项:面向对象的图像-文本对比 (OITC) 损失、面向对象的图像-图像对比 (OIIC) 损失和面向对象的图像判别 (OID) 损失,以提高对象考虑因素、检索准确性和全面性。我们的贡献包括动态视觉注意力调整、增强对象检索的新损失函数以及多对象指令 (MOInst) 数据集。实验表明,我们的方法实现了最先进的性能。

关键词

引用

@article{arxiv.2410.20109,
  title  = {GiVE: Guiding Visual Encoder to Perceive Overlooked Information},
  author = {Junjie Li and Jianghong Ma and Xiaofeng Zhang and Yuhang Li and Jianyang Shi},
  journal= {arXiv preprint arXiv:2410.20109},
  year   = {2025}
}

备注

This paper was accepted by ICME 2025