中文

CONE:一种用于长视频时序定位的高效由粗到精对齐框架

计算机视觉与模式识别 2023-06-01 v2 计算与语言 信息检索

摘要

本文解决一个新兴且具有挑战性的长视频时序定位(VTG)问题,该任务旨在定位与自然语言(NL)查询相关的视频片段。与短视频相比,长视频同样具有高度需求但研究较少,这带来了推理计算成本更高和多模态对齐更弱的新挑战。为应对这些挑战,我们提出 CONE,一种高效的由粗到精(COarse-to-fiNE)对齐框架。CONE 是一种即插即用的框架,构建于现有 VTG 模型之上,通过滑动窗口机制处理长视频。具体而言,CONE(1)引入查询引导的窗口选择策略以加速推理,(2)提出一种通过新颖地结合对比学习的由粗到精机制,以增强长视频的多模态对齐。在两个大规模长视频 VTG 基准上的大量实验一致显示出显著的性能提升(例如在 MAD 上从 3.13% 到 6.87%)和最优(SOTA)结果。分析还揭示了更高的效率:查询引导的窗口选择机制在 Ego4D-NLQ 上将推理时间加速 2 倍,在 MAD 上加速 15 倍,同时保持 SOTA 结果。代码已发布于 https://github.com/houzhijian/CONE。

关键词

引用

@article{arxiv.2209.10918,
  title  = {CONE: An Efficient COarse-to-fiNE Alignment Framework for Long Video Temporal Grounding},
  author = {Zhijian Hou and Wanjun Zhong and Lei Ji and Difei Gao and Kun Yan and Wing-Kwong Chan and Chong-Wah Ngo and Zheng Shou and Nan Duan},
  journal= {arXiv preprint arXiv:2209.10918},
  year   = {2023}
}

备注

ACL 2023 Camera Ready. 14 pages, 7 figures, 4 tables