TimeLoc:长视频中精确时间戳定位的统一端到端框架
计算机视觉与模式识别
2025-03-11 v1 多媒体
摘要
未剪辑视频中的时序定位旨在识别特定时间戳,对视频理解至关重要,但仍具挑战性。该任务包含多个子任务,包括时序动作定位、时序视频定位、瞬间检索和通用事件边界检测。各子领域的现有方法通常针对特定任务设计,缺乏跨领域的泛化能力。本文提出 TimeLoc,一个用于时间戳定位的统一端到端框架,可处理多种任务。首先,我们的方法采用了一个简单而有效的单阶段定位模型,支持文本查询作为输入并输出多个动作。其次,我们以端到端方式联合训练视频编码器和定位模型。为高效处理长视频,我们引入了时间分块,使能够处理超过 30k 帧的视频。第三,我们发现采用多阶段训练策略微调预训练文本编码器可进一步增强文本条件定位。TimeLoc 在多个基准上取得了 SOTA 结果:在 THUMOS14 和 EPIC-Kitchens-100 上较先前最佳方法分别提升 +1.3% 和 +1.9% mAP,在 Kinetics-GEBD 上提升 +1.1%,在 QVHighlights 上提升 +2.94% mAP,并在时序视频定位上取得显著提升(在 TACoS 上 [email protected] 提升 +11.5%,在 Charades-STA 上提升 +6.7%)。我们的代码和检查点将发布于 https://github.com/sming256/TimeLoc。
引用
@article{arxiv.2503.06526,
title = {TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos},
author = {Chen-Lin Zhang and Lin Sui and Shuming Liu and Fangzhou Mu and Zhangcheng Wang and Bernard Ghanem},
journal= {arXiv preprint arXiv:2503.06526},
year = {2025}
}
备注
Code & models will be released at https://github.com/sming256/TimeLoc. The first 4 authors contributes equally