ActAlign:基于语言引导的零样态细粒度视频分类
计算机视觉与模式识别
2025-10-21 v3 机器学习
多媒体
摘要
我们解决的是零样态细粒度动作分类任务(例如篮球中的 Windmill Dunk),该任务中没有可见类别的视频示例或时间标注。虽然图像语言模型(如 CLIP、SigLIP)在开放集识别方面表现良好,但缺乏对视频理解所需的时间建模能力。我们提出了 ActAlign,一种真正的零样态、无训练的方法,将视频分类问题形式化为序列对齐问题,保留了预训练图像语言模型的泛化能力。对于每个类别,大语言模型(LLM)生成有序的子动作序列,并通过动态时间变形(DTW)在共享嵌入空间中与视频帧对齐。无需任何视频文本监督或微调,ActAlign 在 ActionAtlas 上实现了 30.5% 的准确率,该数据集是跨多个运动项目最具多样性的细粒度动作基准;而人类水平仅为 61.6%。ActAlign 在使用 8 倍更少参数的情况下超越了数十亿参数的视频语言模型。该方法具有模型中性和域通用性,表明结构化语言先验与经典对齐方法的结合可以解锁图像语言模型在细粒度视频理解中开放集识别的潜力。
引用
@article{arxiv.2506.22967,
title = {ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment},
author = {Amir Aghdam and Vincent Tao Hu and Björn Ommer},
journal= {arXiv preprint arXiv:2506.22967},
year = {2025}
}
备注
Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/