面向语言定位的弱监督时序邻接网络
计算机视觉与模式识别
2021-07-01 v1
摘要
时序语言定位(TLG)是视觉与语言理解中一个基础且具有挑战性的问题。现有方法主要关注具有时序边界标签的全监督设定,然而其标注成本高昂。本文致力于弱监督 TLG,即给定未剪辑视频多个描述句而不提供时序边界标签。在该任务中,学习句子语义与视觉内容之间强的跨模态语义对齐至关重要。为此,我们提出了一种用于时序语言定位的新型弱监督时序邻接网络(WSTAN)。具体而言,WSTAN 以整个描述段落作为输入,在多示例学习(MIL)范式下利用时序邻接网络学习跨模态语义对齐。此外,我们将一个互补分支集成到框架中,利用来自 MIL 阶段的伪监督显式细化预测。在 MIL 分支与互补分支上设计了一个额外的自判别损失,旨在通过自监督增强语义判别性。我们在三个广泛使用的基准数据集(即 ActivityNet-Captions、Charades-STA 和 DiDeMo)上进行了大量实验,结果证明了我们方法的有效性。
引用
@article{arxiv.2106.16136,
title = {Weakly Supervised Temporal Adjacent Network for Language Grounding},
author = {Yuechen Wang and Jiajun Deng and Wengang Zhou and Houqiang Li},
journal= {arXiv preprint arXiv:2106.16136},
year = {2021}
}
备注
Accepted by IEEE Transactions on Multimedia, 2021