中文

大型视觉语言模型语义接地能力的评估与增强

计算机视觉与模式识别 2024-01-17 v2 计算与语言

摘要

大型视觉语言模型(LVLMs)为多种视觉-语言任务提供了显著益处。然而,阻碍其在现实场景应用(尤其涉及安全性、鲁棒性与可靠性)的一个挑战是其受限的语义接地能力,即把语言连接到图像中引用的物理世界实体或概念的能力。因此,迫切需要对广泛使用的 LVLMs 语义接地能力进行全面评估研究。尽管意义重大,该方向目前尚缺乏充分探究。我们的工作填补了这一空白:设计了一条生成覆盖细粒度语义信息(如颜色、数量、材料等)大规模评估数据集的流程,并对七个流行 LVLMs 的语义接地能力进行了透彻评估。结果凸显了各方面与各程度普遍存在的错误接地。为解决此问题,我们提出一种以数据为中心的增强方法,旨在通过细粒度对话上的多模态指令微调提升 LVLMs 的语义接地能力。在增强后 LVLMs 上的实验显示出解决错误接地问题的显著改进。

关键词

引用

@article{arxiv.2309.04041,
  title  = {Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models},
  author = {Jiaying Lu and Jinmeng Rao and Kezhen Chen and Xiaoyuan Guo and Yawen Zhang and Baochen Sun and Carl Yang and Jie Yang},
  journal= {arXiv preprint arXiv:2309.04041},
  year   = {2024}
}

备注

This paper has been accepted to the AAAI'24 Workshop on Responsible Language Models (ReLM 2024)