中文

基于多模态提示的端到端开放词汇视频视觉关系检测

计算机视觉与模式识别 2025-04-15 v2

摘要

开放词汇视频视觉关系检测旨在通过检测视频中见证和未见证物体之间的未知关系,将视频视觉关系检测扩展到注释类别之外。现有方法通常使用在封闭数据集上训练的轨迹检测器来检测物体轨迹,然后将这些轨迹输入到大规模预训练的视觉语言模型中以实现开放词汇分类。这种对预训练轨迹检测器的强烈依赖限制了其对新物体类别的泛化能力,导致性能下降。为解决这一挑战,我们提出将物体轨迹检测和关系分类统一为一个端到端开放词汇框架。在该框架下,我们提出了一种受关系感知的开放词汇轨迹检测器。它主要由查询式Transformer解码器组成,其中CLIP的视觉编码器被蒸馏用于帧级开放词汇目标检测,以及轨迹关联器。为利用轨迹检测中的关系上下文,嵌入关系查询到Transformer解码器中,并据此设计辅助关系损失,以使解码器能够显式感知物体之间的关系。此外,我们提出了开放词汇关系分类器,利用CLIP的丰富语义知识来发现新型关系。为适应CLIP在关系分类任务中的应用,我们设计了多模态提示方法,采用时空视觉提示进行视觉表征,以及受视觉引导的语言提示进行语言输入。在VidVRD和VidOR两个公开数据集上的大量实验表明,我们框架的有效性。我们还将该框架应用于更具挑战性的跨数据集情景,以进一步证明其泛化能力。

关键词

引用

@article{arxiv.2409.12499,
  title  = {End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting},
  author = {Yongqi Wang and Xinxiao Wu and Shuo Yang and Jiebo Luo},
  journal= {arXiv preprint arXiv:2409.12499},
  year   = {2025}
}

备注

Accepted by TPAMI