具有语义注意力的共定位网络用于视频指代表达式理解
计算机视觉与模式识别
2021-03-24 v1
摘要
本文研究视频中的指代表达式理解问题,该问题因复杂表达式与场景动态而具挑战性。与以往以多阶段(即跟踪、基于候选框的匹配)解决该问题的方法不同,我们从一个新颖视角——\textbf{共定位}(co-grounding),以优雅的单阶段框架处理该问题。我们通过语义注意力学习提升单帧定位精度,并借助共定位特征学习改善跨帧定位一致性。语义注意力学习显式解析不同属性中的指代线索,以降低复杂表达式中的歧义。共定位特征学习通过整合时间相关性增强视觉特征表示,以减少场景动态引起的歧义。实验结果证明了我们的框架在视频定位数据集 VID 和 LiOTB 上生成跨帧准确且稳定结果的优越性。我们的模型也适用于图像中的指代表达式理解,在 RefCOCO 数据集上性能提升即为例证。项目见 https://sijiesong.github.io/co-grounding。
引用
@article{arxiv.2103.12346,
title = {Co-Grounding Networks with Semantic Attention for Referring Expression Comprehension in Videos},
author = {Sijie Song and Xudong Lin and Jiaying Liu and Zongming Guo and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2103.12346},
year = {2021}
}
备注
Accepted to CVPR2021. The project page is at https://sijiesong.github.io/co-grounding