基于结构化变分跨图对应学习的组合时序定位
计算机视觉与模式识别
2022-03-29 v2
摘要
视频中的时序定位旨在定位与给定查询语句在语义上对应的目标视频片段。得益于自然语言描述的语义多样性,时序定位允许超越预定义类别的活动定位,近年来受到越来越多的关注。语义多样性根植于语言学中的组合性原则,即新颖语义可通过以新颖方式组合已知词来系统性描述(组合泛化)。然而,当前的时序定位数据集并未专门测试组合泛化能力。为系统性度量时序定位模型的组合泛化能力,我们引入了一项新的组合时序定位任务,并构建了两个新的数据集划分,即Charades-CG和ActivityNet-CG。在我们的新数据集划分上评估最先进的方法,我们经验性地发现它们无法泛化到由已见词新颖组合而成的查询。为应对该挑战,我们提出了一种变分跨图推理框架,该框架显式地将视频和语言分解为多个结构化层次,并学习它们之间的细粒度语义对应。实验表明了我们的方法具有优越的组合泛化能力。本工作的代码库位于 https://github.com/YYJMJC/ Compositional-Temporal-Grounding。
引用
@article{arxiv.2203.13049,
title = {Compositional Temporal Grounding with Structured Variational Cross-Graph Correspondence Learning},
author = {Juncheng Li and Junlin Xie and Long Qian and Linchao Zhu and Siliang Tang and Fei Wu and Yi Yang and Yueting Zhuang and Xin Eric Wang},
journal= {arXiv preprint arXiv:2203.13049},
year = {2022}
}
备注
Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2022