面向少样本动作识别的无时序对齐视频匹配
计算机视觉与模式识别
2025-04-09 v1 人工智能
摘要
少样本动作识别 (FSAR) 旨在仅用少量标记视频实例训练模型。FSAR 的关键挑战在于处理不同叙事轨迹以实现精确视频匹配。虽然帧级和元组级对齐方法取得了良好进展, 但这些方法高度依赖预定义且长度依赖的对齐单元 (如帧或元组), 这限制了对动作长度和速度不同的灵活性。在本工作中, 我们引入了一种 novel TEmporal Alignment-free Matching (TEAM) 方法, 该方法在动作表示和匹配期间消除对时序单元的需求。具体而言, TEAM 以固定的模式令牌集表示每个视频, 这些令牌捕获与视频实例无关的全球判别性线索, 而不考虑动作长度或速度, 从而确保其灵活性。此外, TEAM 本身具有高效性, 使用令牌级比较来衡量视频之间的相似度, 不同于现有方法依赖成对比较进行时序对齐。我们还提出了一种适应过程, 识别并消除类别之间共享的常见信息, 即使在新类别之间也能建立清晰边界。广泛的实验表明 TEAM 的有效性。代码已提供于 github.com/leesb7426/TEAM。
引用
@article{arxiv.2504.05956,
title = {Temporal Alignment-Free Video Matching for Few-shot Action Recognition},
author = {SuBeen Lee and WonJun Moon and Hyun Seok Seong and Jae-Pil Heo},
journal= {arXiv preprint arXiv:2504.05956},
year = {2025}
}
备注
10 pages, 7 figures, 6 tables, Accepted to CVPR 2025 as Oral Presentation