EVOQUER:通过以视频为枢轴的反向查询生成增强时序定位
计算机视觉与模式识别
2021-09-13 v1 人工智能
计算与语言
摘要
时序定位旨在预测与自然语言查询输入相对应的视频片段的时间区间。在本工作中,我们提出了 EVOQUER,这是一个结合了现有文本到视频定位模型和视频辅助查询生成网络的时序定位框架。给定查询和未剪辑视频,时序定位模型预测目标区间,并将预测的视频片段输入到视频翻译任务中,通过生成输入查询的简化版本来进行翻译。EVOQUER 通过结合来自时序定位和查询生成的损失函数作为反馈,形成了闭环学习。我们在两个广泛使用的数据集 Charades-STA 和 ActivityNet 上的实验表明,EVOQUER 在 [email protected] 上分别取得了 1.05 和 1.31 的显著提升。我们还讨论了查询生成任务如何通过解释时序定位模型的行为来促进误差分析。
引用
@article{arxiv.2109.04600,
title = {EVOQUER: Enhancing Temporal Grounding with Video-Pivoted BackQuery Generation},
author = {Yanjun Gao and Lulu Liu and Jason Wang and Xin Chen and Huayan Wang and Rui Zhang},
journal= {arXiv preprint arXiv:2109.04600},
year = {2021}
}
备注
Accepted by Visually Grounded Interaction and Language (ViGIL) Workshop at NAACL 2021