中文

Artemis: 迈向复杂视频中的指代理解

计算机视觉与模式识别 2024-06-04 v1 人工智能

摘要

视频承载着丰富的视觉信息,包括物体描述、动作、交互等,但现有的多模态大语言模型(MLLM)在诸如基于视频的指代等指代理解场景中表现不佳。在本文中,我们提出了Artemis,一个将基于视频的指代理解推向更精细水平的MLLM。给定一个视频,Artemis接收一个带有任意视频帧中边界框的自然语言问题,并描述整个视频中引用的目标。实现这一目标的关键在于提取紧凑的、目标特定的视频特征,我们通过从视频中跟踪和选择时空特征建立了一个坚实的基线。我们在新建立的包含45K视频问答对的VideoRef45K数据集上训练Artemis,并设计了一个计算高效的三阶段训练流程。定量和定性结果都令人满意。此外,我们展示了该模型可以与视频定位和文本摘要工具集成,以理解更复杂的场景。代码和数据可在https://github.com/qiujihao19/Artemis获取。

关键词

引用

@article{arxiv.2406.00258,
  title  = {Artemis: Towards Referential Understanding in Complex Videos},
  author = {Jihao Qiu and Yuan Zhang and Xi Tang and Lingxi Xie and Tianren Ma and Pengyu Yan and David Doermann and Qixiang Ye and Yunjie Tian},
  journal= {arXiv preprint arXiv:2406.00258},
  year   = {2024}
}

备注

19 pages, 14 figures. Code and data are available at https://github.com/qiujihao19/Artemis