用于视频定位的带序列匹配的并行注意力网络
计算与语言
2023-04-26 v1 计算机视觉与模式识别
摘要
给定一个视频,视频定位旨在检索与语言查询在语义上相对应的时间片段。在本工作中,我们提出一种带序列匹配的并行注意力网络 (SeqPAN) 来解决该任务中的挑战:多模态表示学习,以及目标片段边界预测。我们设计了一个自引导并行注意力模块,以有效捕获视频与文本之间的自模态上下文和跨模态注意力信息。受自然语言处理中序列标注任务的启发,我们将真值片段拆分为起始、内部和结束区域。随后我们提出一种序列匹配策略,利用区域标签引导起止边界预测。在三个数据集上的实验结果表明,SeqPAN 优于 SOTA 方法。此外,自引导并行注意力模块和序列匹配模块的有效性得到了验证。
引用
@article{arxiv.2105.08481,
title = {Parallel Attention Network with Sequence Matching for Video Grounding},
author = {Hao Zhang and Aixin Sun and Wei Jing and Liangli Zhen and Joey Tianyi Zhou and Rick Siow Mong Goh},
journal= {arXiv preprint arXiv:2105.08481},
year = {2023}
}
备注
15 pages, 10 figures, 7 tables, Findings at ACL 2021