中文

开放词汇动作检测的扩展

计算机视觉与模式识别 2025-08-15 v4

摘要

本工作聚焦于开放词汇动作检测。现有的动作检测方法主要局限于封闭场景,依赖复杂且参数丰富的架构。将这些模型扩展到开放词汇设置面临两个关键挑战:1)缺乏大规模包含众多动作类别的数据集以进行稳健训练;2)参数丰富的改编可能导致对预训练的视觉语言对比模型进行额外的非预训练参数适配,增加对基础动作类别的过拟合风险。首先,我们引入一种仅依赖编码器的多模态模型,用于视频动作检测,减少对参数丰富添加对视频动作检测的依赖。其次,我们引入一种简单的弱监督训练策略,以利用现有的封闭场景动作检测数据集进行预训练。最后,我们摒弃了先前工作在开放词汇动作检测中使用的病态的 base-to-novel 基准测试,设计了新的基准测试,在不使用训练数据的情况下评估现有的封闭场景动作检测数据集,提供新的基准结果以供后续工作参考。我们的代码已公开:https://siatheindochinese.github.io/sia_act_page/。

关键词

引用

@article{arxiv.2504.03096,
  title  = {Scaling Open-Vocabulary Action Detection},
  author = {Zhen Hao Sia and Yogesh Singh Rawat},
  journal= {arXiv preprint arXiv:2504.03096},
  year   = {2025}
}