中文

F$^3$Set:用于分析视频中快速、频繁和细粒度事件的基准

计算机视觉与模式识别 2025-04-16 v2 人工智能

摘要

分析快速、频繁和细粒度 (F3^3) 事件在视频分析和多模态 LLM 中 presents 一个重大的挑战。当前方法在准确识别满足所有 F3^3 标准的事件方面困难重重,由于诸如运动模糊和细微视觉差异等问题。为推进视频理解研究,我们引入 F3^3Set,一个用于精确 F3^3 事件检测的视频数据集基准。F3^3Set 中的数据集以其广泛的规模和详尽的细节著称,通常涵盖超过 1,000 种事件类型,具有精确的时间戳和支持多级细粒度。目前,F3^3Set 包含几个运动项目数据集,该框架也可扩展到其他应用。我们在 F3^3Set 上评估了流行的时序动作理解方法,揭示了现有技术面临的重大挑战。此外,我们提出了一种新方法 F3^3ED,用于 F3^3 事件检测,实现了卓越的性能。该数据集、模型和基准代码均可在 https://github.com/F3Set/F3Set 上获得。

关键词

引用

@article{arxiv.2504.08222,
  title  = {F$^3$Set: Towards Analyzing Fast, Frequent, and Fine-grained Events from Videos},
  author = {Zhaoyu Liu and Kan Jiang and Murong Ma and Zhe Hou and Yun Lin and Jin Song Dong},
  journal= {arXiv preprint arXiv:2504.08222},
  year   = {2025}
}

备注

ICLR 2025; Website URL: https://lzyandy.github.io/f3set-website/