具有时间边界不确定性的视频活动定位
计算机视觉与模式识别
2022-07-22 v2
摘要
当前视频活动随时间定位的方法隐式假设用于模型训练的活动时间边界是确定且精确的。然而,在非脚本自然视频中,不同活动大多平滑过渡,因此在标注中精确确定活动何时开始和结束本质上是模糊的。这种时间标注中的不确定性目前在模型训练中被忽略,导致学习到不匹配的视频-文本相关性,在测试中泛化能力差。本工作中,我们通过引入弹性时刻边界(EMB)解决该问题,以容纳灵活自适应的活动的时间边界,从而建模普遍可解释的视频-文本相关性,并对预固定标注中潜在的时间不确定性具有容忍度。具体而言,我们通过挖掘和发现帧级时间端点自适应构建弹性边界,使视频片段与查询句子的对齐最大化。为实现更准确匹配(片段内容注意力)和更鲁棒定位(片段弹性边界),我们通过新颖的引导注意力机制在片段级内容约束下优化帧级端点的选择。在三个视频活动定位基准上的大量实验令人信服地展示了EMB相对于现有未建模不确定性方法的优势。
引用
@article{arxiv.2206.12923,
title = {Video Activity Localisation with Uncertainties in Temporal Boundary},
author = {Jiabo Huang and Hailin Jin and Shaogang Gong and Yang Liu},
journal= {arXiv preprint arXiv:2206.12923},
year = {2022}
}