面向混合模式查询的在线视频定位 OVG-HQ
计算机视觉与模式识别
2025-08-19 v1
摘要
视频定位(VG)任务专注于基于查询(通常为文本形式)在视频中定位特定时刻。然而,传统 VG 在面对流媒体视频或使用视觉线索查询时等场景时难以胜任。为填补这一空白,我们提出了一种新任务,即 Online Video Grounding with Hybrid-modal Queries (OVG-HQ),其允许使用文本、图像、视频片段及其组合进行在线片段定位。该任务提出了两个新挑战:在线设置下的上下文有限,以及训练期间的模态不平衡问题,其中主导模态会压倒弱模态。为解决这些问题,我们提出了 OVG-HQ-Unify 框架,特点是包含参数记忆块(PMB),用于强化当前决策中保留先前学习知识;以及跨模态蒸馏策略,指导非主导模态的学习。该设计使单个模型能够有效处理混合模式查询。由于缺乏合适的数据集,我们构建了 QVHighlights-Unify,一个包含多模态查询的扩充数据集。此外,由于离线指标忽略了预测时效性,我们将其适应于在线设置,引入 oR@n、IoU=m 和在线平均精度(omAP)来评估准确率和效率。实验表明,我们的 OVG-HQ-Unify 超越了现有模型,为在线、混合模式视频定位提供了稳健的解决方案。源代码和数据集均可在 https://github.com/maojiaqi2324/OVG-HQ 获取。
引用
@article{arxiv.2508.11903,
title = {OVG-HQ: Online Video Grounding with Hybrid-modal Queries},
author = {Runhao Zeng and Jiaqi Mao and Minghao Lai and Minh Hieu Phan and Yanjie Dong and Wei Wang and Qi Chen and Xiping Hu},
journal= {arXiv preprint arXiv:2508.11903},
year = {2025}
}
备注
Accepted to ICCV 2025