中文

IDA-VLM:面向电影理解的基于身份感知的大型视觉语言模型

计算机视觉与模式识别 2024-07-11 v1 人工智能

摘要

大型视觉语言模型(LVLMs)的快速发展展示了多种新兴能力。然而,当前模型仅关注单一场景的视觉内容,尚未探索跨不同场景实例之间的关联,这对于理解具有多个角色和复杂情节的复杂视觉内容(如电影)至关重要。为实现电影理解,LVLMs的关键初始步骤是发掘跨多个视觉场景中角色身份的记忆与识别潜力。为此,我们提出基于身份参考的视觉指令调优方法,开发了身份感知的大型视觉语言模型(IDA-VLM)。此外,本研究引入了新颖的基准数据集MM-ID,用于检验LVLMs在实例身份记忆与识别上的能力,涵盖四个维度:匹配、位置、问答和描述。我们的发现表明,现有LVLMs在识别和关联带有身份参考的实例身份方面存在局限。本文为未来人工智能系统拥有多身份视觉输入能力铺平了道路,从而促进了对复杂视觉叙事(如电影)的理解。

关键词

引用

@article{arxiv.2407.07577,
  title  = {IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model},
  author = {Yatai Ji and Shilong Zhang and Jie Wu and Peize Sun and Weifeng Chen and Xuefeng Xiao and Sidi Yang and Yujiu Yang and Ping Luo},
  journal= {arXiv preprint arXiv:2407.07577},
  year   = {2024}
}