中文

MRTNet:用于视频句子定位的多分辨率时间网络

计算机视觉与模式识别 2022-12-29 v2

摘要

给定一段未裁剪视频与自然语言查询,视频句子定位旨在定位视频中的目标时间片段。现有方法主要通过在单一时间分辨率上匹配和对齐描述句与视频片段的语义来处理该任务,而忽略了不同分辨率下视频内容的时间一致性。本工作中,我们提出一种新颖的多分辨率时间视频句子定位网络:MRTNet,其由多模态特征编码器、多分辨率时间(MRT)模块和预测器模块组成。MRT 模块是一个编码器-解码器网络,解码器部分的输出特征与 Transformers 结合以预测最终的起止时间戳。特别地,我们的 MRT 模块是热插拔的,意味着它可无缝集成进任何无锚框模型。此外,我们利用混合损失来监督 MRT 模块中的跨模态特征,以在帧级、片段级和序列级三个尺度上实现更精准的定位。在三个常用数据集上的大量实验已表明 MRTNet 的有效性。

关键词

引用

@article{arxiv.2212.13163,
  title  = {MRTNet: Multi-Resolution Temporal Network for Video Sentence Grounding},
  author = {Wei Ji and Long Chen and Yinwei Wei and Yiming Wu and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2212.13163},
  year   = {2022}
}

备注

work in progress