HERO:面向视频中开放词汇时间句子 grounding 的层次嵌入-精炼方法
计算机视觉与模式识别
2026-03-10 v1
摘要
视频时间句子 grounding (TSGV) 旨在在视频中定位与给定自然语言查询相对应的时间段。尽管近期取得了进展,但大多数现有 TSGV 方法 operate in closed-vocabulary settings,这限制了其在涉及新颖或多样化语言表达的真实世界查询中的泛化能力。为弥合这一关键差距,我们提出开放词汇 TSGV (OV-TSGV) 任务,并构建第一个专门基准——Charades-OV 和 ActivityNet-OV——模拟真实的词汇偏移和释义变体。这些基准促进了超越训练中看到的概念进行系统评估。为解决 OV-TSGV,我们提出 HERO (Hierarchical Embedding-Refinement for Open-Vocabulary grounding),一个统一框架,利用层次语言嵌入并执行并行跨模态精炼。HERO 联合建模多层次语义,通过语义引导的视觉过滤和对比遮盖文本精炼来增强视频-语言对齐。在标准和开放词汇基准上的大量实验表明,HERO 在开放词汇场景下一致优于最新方法,验证了其强大的泛化能力,强调了 OV-TSGV 作为新研究方向的重要性。
引用
@article{arxiv.2603.06732,
title = {HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos},
author = {Tingting Han and Xinsong Tao and Yufei Yin and Min Tan and Sicheng Zhao and Zhou Yu},
journal= {arXiv preprint arXiv:2603.06732},
year = {2026}
}