中文

面向文本驱动的在线动作检测

计算机视觉与模式识别 2026-01-30 v1

摘要

检测正在发生的动作对于视频监控、自动驾驶和人机交互等应用至关重要。被称为在线动作检测的这一任务需要对流式视频中的动作进行分类,处理背景噪声,并应对不完整的动作。变换器架构目前处于最先进水平,但近期计算机视觉领域的进展,特别是视觉语言模型(VLM)的潜力,对于该问题仍 largely 未被充分利用,这部分原因是计算成本较高。本文引入了 TOAD:一个支持零样本和少样本学习的文本驱动在线动作检测架构。TOAD 利用 CLIP(对比语言-图像预训练)文本嵌入,使其能够在不显著计算开销的情况下高效利用 VLM。我们的模型在 THUMOS14 数据集上实现了 82.46% 的 mAP,超越了现有方法,并在 THUMOS14 和 TVSeries 数据集上为零样本和少样本性能设定了新的基线。

关键词

引用

@article{arxiv.2501.13518,
  title  = {Text-driven Online Action Detection},
  author = {Manuel Benavent-Lledo and David Mulero-Pérez and David Ortiz-Perez and Jose Garcia-Rodriguez},
  journal= {arXiv preprint arXiv:2501.13518},
  year   = {2026}
}

备注

Published in Integrated Computer-Aided Engineering