极简时序视频定位:多尺度邻域注意力与放大边界检测
计算机视觉与模式识别
2023-07-21 v1
摘要
时序视频定位(TVG)旨在从未裁剪视频中检索语言查询的时间区间。TVG中的一个重大挑战是低“语义噪声比(SNR)”,其导致SNR越低性能越差。先前工作使用复杂技术应对该挑战。本文提出一种极简TVG模型,由两个核心模块组成,即多尺度邻域注意力和放大边界检测。多尺度邻域注意力将每个视频token限制为仅从其邻域聚合视觉上下文,从而能够从高比例噪声中以多尺度特征层次提取最具区分性的信息。放大边界检测随后聚焦于所选top候选的局部判别以实现细粒度定位调整。通过端到端训练策略,我们的模型在不同TVG基准上取得了有竞争力的性能,同时得益于其轻量架构,还具有推理速度更快和模型参数更少的优势。
引用
@article{arxiv.2307.10567,
title = {No-frills Temporal Video Grounding: Multi-Scale Neighboring Attention and Zoom-in Boundary Detection},
author = {Qi Zhang and Sipeng Zheng and Qin Jin},
journal= {arXiv preprint arXiv:2307.10567},
year = {2023}
}