HERO:基于对比动作对应的分层时空推理端到端视频对象定位框架
多媒体
2022-08-12 v1
摘要
视频对象定位(VOG)是将视频中的空间对象区域与描述性自然语言查询相关联的问题。这是一项具有挑战性的视觉-语言任务,需要构建正确的跨模态对应并建模查询视频与字幕的适当时空上下文,从而精确本地化特定对象。本文中,我们通过一种称为基于对比动作对应的分层时空推理(HERO)的新颖框架来解决该任务。我们从先前工作忽视的两个方面研究 VOG 任务:(1)对比动作对应感知检索。注意到细粒度视频语义(如多个动作)与标注的语言查询(如单个动作)并未完全对齐,我们首先引入弱监督对比学习,依靠视频-字幕动作语义对应将视频分类为动作一致帧与动作无关帧。该设计可为后续更精确的 VOG 构建细粒度跨模态对应。(2)分层时空建模改进。尽管基于 transformer 的 VOG 模型在序列模态(即视频与字幕)建模中展现出潜力,现有证据也表明 transformer 存在时空局部性不敏感的问题。受此启发,我们精心设计了分层推理层以解耦全连接多头注意力并去除冗余干扰关联。此外,我们提出的金字塔与偏移对齐机制有效提升了邻域空间区域与时序帧的跨模态信息利用。我们进行了大量实验,表明我们的 HERO 在两个基准数据集上取得显著改进,优于现有技术。
引用
@article{arxiv.2208.05818,
title = {HERO: HiErarchical spatio-tempoRal reasOning with Contrastive Action Correspondence for End-to-End Video Object Grounding},
author = {Mengze Li and Tianbao Wang and Haoyu Zhang and Shengyu Zhang and Zhou Zhao and Wenqiao Zhang and Jiaxu Miao and Shiliang Pu and Fei Wu},
journal= {arXiv preprint arXiv:2208.05818},
year = {2022}
}