探索基于自训练的开放词汇时序动作定位可扩展性
计算机视觉与模式识别
2024-12-20 v3 人工智能
摘要
时序动作定位 (TAL) 的词汇规模受限于大规模标注数据集的稀缺。为突破这一限制,近期研究将视觉语言模型 (VLM) 如 CLIP 集成到开放词汇时序动作定位 (OV-TAL) 中。然而,尽管基于大规模数据集训练的 VLM 取得了显著成功,现有的 OV-TAL 方法仍依赖于规模受限的人工标注 TAL 数据集来训练动作定位器,从而限制了其泛化能力。本文探讨了利用无标注 YouTube 视频进行自训练以实现 OV-TAL 可扩展性的问题。我们的方法包含两个阶段:(1) 在人工标注 TAL 数据集上训练一个类无关的动作定位器,以为无标注视频生成伪标签;(2) 将得到的大规模伪标注数据集用于训练定位器。大量实验表明,利用 web规模视频进行自训练显著提升了动作定位器的泛化性。此外,我们识别了现有 OV-TAL 评估方案的局限性,并提出了新的基准进行全面评估。最后,我们展示了大型多模态模型 Gemini-1.5 在新基准上的 TAL 性能。代码已发布于 https://github.com/HYUNJS/STOV-TAL。
引用
@article{arxiv.2407.07024,
title = {Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization},
author = {Jeongseok Hyun and Su Ho Han and Hyolim Kang and Joon-Young Lee and Seon Joo Kim},
journal= {arXiv preprint arXiv:2407.07024},
year = {2024}
}
备注
Accepted to WACV 2025