中文

ShotVL:基于语言查询的以人为中心的高光帧检索

计算机视觉与模式识别 2024-12-18 v1

摘要

现有以人为中心的视频理解工作通常侧重于分析特定时刻或整个视频。然而,许多应用要求在帧级别具有更高的精度。在本工作中,我们提出了一项新任务 BestShot,旨在通过语言查询在以人为中心的视频中定位高光帧。该任务不仅要求对人体动作的深度语义理解,还要求精确的时间定位。为支持该任务,我们引入了 BestShot Benchmark。该基准通过结合人工标注的高光帧、详细的文本描述和持续时间标签精心构建而成。这些描述包含三个关键要素:(1)视觉内容;(2)细粒度动作;以及(3)人体姿态描述。这些要素共同提供了识别视频中确切高光帧所需的精度。为解决这一问题,我们收集了两个不同的数据集: ShotGPT4o 数据集,由 GPT-4o 算法生成;以及 Image-SMPLText 数据集,这是一个利用 PoseScript 和现有姿态估计数据集构建的、具有大规模且准确的逐帧姿态描述的数据集。基于这些数据集,我们提出了一个强基线模型 ShotVL,该模型从 InternVL 微调而来,专门针对 BestShot 任务。我们强调了该模型令人印象深刻的零样本能力,并与现有的 SOTA 模型进行了比较分析。ShotVL 在 BestShot Benchmark 上较 InternVL 取得了 52% 的显著提升,在 THUMOS14 Benchmark 上取得了 57% 的显著提升,同时在通用图像分类和检索中保持了 SOTA 性能。

关键词

引用

@article{arxiv.2412.12675,
  title  = {ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries},
  author = {Wangyu Xue and Chen Qian and Jiayi Wu and Yang Zhou and Wentao Liu and Ju Ren and Siming Fan and Yaoxue Zhang},
  journal= {arXiv preprint arXiv:2412.12675},
  year   = {2024}
}