F$^3$Set:用于分析视频中快速、频繁和细粒度事件的基准
计算机视觉与模式识别
2025-04-16 v2 人工智能
摘要
分析快速、频繁和细粒度 (F) 事件在视频分析和多模态 LLM 中 presents 一个重大的挑战。当前方法在准确识别满足所有 F 标准的事件方面困难重重,由于诸如运动模糊和细微视觉差异等问题。为推进视频理解研究,我们引入 FSet,一个用于精确 F 事件检测的视频数据集基准。FSet 中的数据集以其广泛的规模和详尽的细节著称,通常涵盖超过 1,000 种事件类型,具有精确的时间戳和支持多级细粒度。目前,FSet 包含几个运动项目数据集,该框架也可扩展到其他应用。我们在 FSet 上评估了流行的时序动作理解方法,揭示了现有技术面临的重大挑战。此外,我们提出了一种新方法 FED,用于 F 事件检测,实现了卓越的性能。该数据集、模型和基准代码均可在 https://github.com/F3Set/F3Set 上获得。
引用
@article{arxiv.2504.08222,
title = {F$^3$Set: Towards Analyzing Fast, Frequent, and Fine-grained Events from Videos},
author = {Zhaoyu Liu and Kan Jiang and Murong Ma and Zhe Hou and Yun Lin and Jin Song Dong},
journal= {arXiv preprint arXiv:2504.08222},
year = {2025}
}
备注
ICLR 2025; Website URL: https://lzyandy.github.io/f3set-website/