面向文本驱动的在线动作检测
计算机视觉与模式识别
2026-01-30 v1
摘要
检测正在发生的动作对于视频监控、自动驾驶和人机交互等应用至关重要。被称为在线动作检测的这一任务需要对流式视频中的动作进行分类,处理背景噪声,并应对不完整的动作。变换器架构目前处于最先进水平,但近期计算机视觉领域的进展,特别是视觉语言模型(VLM)的潜力,对于该问题仍 largely 未被充分利用,这部分原因是计算成本较高。本文引入了 TOAD:一个支持零样本和少样本学习的文本驱动在线动作检测架构。TOAD 利用 CLIP(对比语言-图像预训练)文本嵌入,使其能够在不显著计算开销的情况下高效利用 VLM。我们的模型在 THUMOS14 数据集上实现了 82.46% 的 mAP,超越了现有方法,并在 THUMOS14 和 TVSeries 数据集上为零样本和少样本性能设定了新的基线。
引用
@article{arxiv.2501.13518,
title = {Text-driven Online Action Detection},
author = {Manuel Benavent-Lledo and David Mulero-Pérez and David Ortiz-Perez and Jose Garcia-Rodriguez},
journal= {arXiv preprint arXiv:2501.13518},
year = {2026}
}
备注
Published in Integrated Computer-Aided Engineering