基于时序全局文本知识的视频句子 grounding
计算机视觉与模式识别
2024-06-04 v2 计算与语言
摘要
时序句子 grounding涉及从自然语言查询中检索视频片段。许多现有工作直接将给定视频和时序局部查询用于时序 grounding,忽略了不同模态之间固有的领域差距。本文我们利用包含广泛时序全局文本知识的伪查询特征,从同一视频-查询对中提取这些知识,以增强领域差距的桥接,并实现多模态特征之间的更高相似性。具体而言,我们提出了伪查询中介网络(PIN),通过对比学习实现视觉和综合伪查询特征在特征空间内的 improved 对齐。随后,我们利用可学习的提示封装伪查询的知识,将其传递到文本编码器和多模态融合模块中,进一步增强视觉和语言之间的特征对齐,以实现更好的时序 grounding。在Charades-STA和ActivityNet-Captions数据集上进行的大量实验表明,我们方法的有效性。
关键词
引用
@article{arxiv.2404.13611,
title = {Video sentence grounding with temporally global textual knowledge},
author = {Cai Chen and Runzhong Zhang and Jianjun Gao and Kejun Wu and Kim-Hui Yap and Yi Wang},
journal= {arXiv preprint arXiv:2404.13611},
year = {2024}
}