中文

基于内容条件查询的Transformer视频指代表达理解

计算机视觉与模式识别 2023-10-26 v1 计算与语言

摘要

视频指代表达理解(REC)旨在根据查询的自然语言在视频中定位目标对象。近期基于Transformer的方法借助可学习查询改进了视频REC。然而,我们认为,鉴于文本监督带来的视频REC的开放世界特性,这种朴素的查询设计并不理想。面对大量潜在语义类别,仅依赖少数缓慢更新的查询不足以刻画它们。我们对此问题的解决方案是创建以输入视频和语言为条件的动态查询,以建模所指代的多样对象。具体而言,我们在帧中放置固定数量的可学习边界框,并利用对应的区域特征提供先验信息。此外,我们注意到当前查询特征忽视了跨模态对齐的重要性。为此,我们将句子中的特定短语与语义相关的视觉区域对齐,并在现有视频数据集(VID-Sentence和VidSTG)中加以标注。通过结合这两种设计,我们提出的模型(称为ConFormer)在广泛基准的数据集上优于其他模型。例如,在VID-Sentence数据集的测试划分上,ConFormer在[email protected]上相比先前最先进模型取得了8.75%的绝对提升。

关键词

引用

@article{arxiv.2310.16402,
  title  = {Video Referring Expression Comprehension via Transformer with Content-conditioned Query},
  author = {Ji Jiang and Meng Cao and Tengtao Song and Long Chen and Yi Wang and Yuexian Zou},
  journal= {arXiv preprint arXiv:2310.16402},
  year   = {2023}
}

备注

Accepted to ACM International Conference on Multimedia Workshop (ACM MM), 2023. arXiv admin note: substantial text overlap with arXiv:2210.02953