基于信息树端到端建模的一次性自然语言空间视频定位
计算机视觉与模式识别
2022-05-24 v2
摘要
自然语言空间视频定位旨在以描述性句子为查询,检测视频帧中的相关物体。尽管取得了巨大进展,现有大多数方法依赖密集视频帧标注,需要大量人力。为在有限标注预算下实现有效定位,我们研究一次性视频定位,并以端到端方式仅用一帧标注来学习在所有视频帧中定位自然语言。端到端一次性视频定位的一大挑战是存在与语言查询或标注帧无关的视频帧。另一挑战涉及有限监督,可能导致表征学习低效。为应对这些挑战,我们设计了基于信息树的一次性视频定位端到端模型(IT-OS)。其关键模块信息树可基于分支搜索与分支裁剪技术消除无关帧的干扰。此外,基于信息树提出了若干自监督任务,以在标注不足情况下改进表征学习。在基准数据集上的实验证明了我们模型的有效性。
引用
@article{arxiv.2203.08013,
title = {End-to-End Modeling via Information Tree for One-Shot Natural Language Spatial Video Grounding},
author = {Mengze Li and Tianbao Wang and Haoyu Zhang and Shengyu Zhang and Zhou Zhao and Jiaxu Miao and Wenqiao Zhang and Wenming Tan and Jin Wang and Peng Wang and Shiliang Pu and Fei Wu},
journal= {arXiv preprint arXiv:2203.08013},
year = {2022}
}