中文

BEAR:面向动作与环境因素的细粒度行为识别视频数据集

计算机视觉与模式识别 2025-03-27 v1

摘要

行为识别是视频表征学习中的重要任务。其核心问题在于学习有助于行为识别的有效特征。近年来,研究者开始关注细粒度行为识别,该任务提供相似行为样本,促使模型关注行为中更具区分性的细节特征。然而,以往的细粒度行为研究仅控制部分信息使之相似,导致对现有工作的评估既不公平也不全面。在本工作中,我们构建了一个新的视频细粒度行为数据集,命名为 BEAR,提供专注于定义行为的两个主要因素——环境与动作——的细粒度(即相似)行为。数据集包含两种细粒度行为协议,即相似环境下的细粒度行为与相似动作下的细粒度行为,以及多种子协议以应对不同场景。进一步地,基于该数据集,我们使用多种行为识别模型进行了大量实验。本研究主要探讨输入模态这一关键要素对行为识别中环境与动作相关方面的影响。实验结果揭示了若干具有重要参考价值的发现,对后续研究具有深远意义。

关键词

引用

@article{arxiv.2503.20209,
  title  = {BEAR: A Video Dataset For Fine-grained Behaviors Recognition Oriented with Action and Environment Factors},
  author = {Chengyang Hu and Yuduo Chen and Lizhuang Ma},
  journal= {arXiv preprint arXiv:2503.20209},
  year   = {2025}
}

备注

Accept by ICME2025