中文

基于内容感知查询Transformer的视频指代表达理解

计算机视觉与模式识别 2022-10-07 v1

摘要

视频指代表达理解(REC)旨在根据自然语言表述在视频帧中定位目标对象。近来,基于Transformer的方法大幅提升了性能上限。然而,我们认为当前的查询设计并非最优且存在两点缺陷:1)训练收敛过程缓慢;2)缺乏细粒度对齐。为缓解此问题,我们旨在将纯可学习查询与内容信息相耦合。具体而言,我们在帧上设定固定数量的可学习边界框,并利用对齐的区域特征提供丰富线索。此外,我们显式地将句子中的特定短语关联到语义相关的视觉区域。为此,我们分别通过为VID-Sentence与VidSTG数据集增补整句中的显式指代词,引入了两个新数据集(即VID-Entity与VidSTG-Entity)。得益于此,我们在区域-短语层面进行细粒度跨模态对齐,从而获得更细致的特征表示。结合上述两种设计,我们提出的模型(称为ContFormer)在广泛基准数据集上取得了最先进的性能。例如在VID-Entity数据集上,相较先前SOTA,ContFormer在[email protected]上实现了8.75%的绝对提升。

关键词

引用

@article{arxiv.2210.02953,
  title  = {Video Referring Expression Comprehension via Transformer with Content-aware Query},
  author = {Ji Jiang and Meng Cao and Tengtao Song and Yuexian Zou},
  journal= {arXiv preprint arXiv:2210.02953},
  year   = {2022}
}