中文

面向视频瞬时检索的对象中心框架

计算机视觉与模式识别 2025-12-23 v1

摘要

大多数现有的视频瞬时检索方法依赖于帧级或片段级特征的时间序列,这些特征主要编码全局视觉和语义信息。然而,这类表征往往难以捕获细粒度的对象语义和外观,这在定位由特定实体及其相互作用描述的瞬时时至关重要。特别是,对象层面的时序动态长期被忽视,限制了现有方法在需要详细对象级推理场景中的效果。为此,我们提出一种新颖的对象中心瞬时检索框架。该方法首先通过场景图解析器提取查询相关对象,然后从视频帧生成场景图以表示这些对象及其关系。基于场景图,我们构建对象层面的特征序列,以编码丰富的视觉和语义信息。这些序列由关系轨迹变换器处理,建模对象在时间上的时空关联。通过显式捕获对象状态的变化,本框架实现了与对象导向查询更精确的瞬时定位。我们在三个基准数据集上评估了该方法:Charades-STA、QVHighlights 和 TACoS。实验结果表明,我们的方法在所有基准数据集上均优于现有最先进的方法。

关键词

引用

@article{arxiv.2512.18448,
  title  = {Object-Centric Framework for Video Moment Retrieval},
  author = {Zongyao Li and Yongkang Wong and Satoshi Yamazaki and Jianquan Liu and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2512.18448},
  year   = {2025}
}

备注

AAAI2026