中文

基于稀疏语义编码的开放词汇动作识别的时空相似性体积聚合

计算机视觉与模式识别 2026-05-25 v1

摘要

近期的开放词汇动作识别(OVAR)方法通常在计算文本对齐前将视觉特征聚合为全局表示,这会遮蔽局部 patch 信息和细粒度时空线索。我们提出 Similarity Volume Aggregation (SimVA),构建稠密 4D 时空相似性体积的框架,从 patch 级视觉-文本相似性出发。SimVA 在局部视频标记和动作类别之间构建时空相似性体积,并通过类别采样确保相似性聚合可扩展至大型词汇表。相似性体积经空间聚合细化,语境化局部相似模式以提高帧内一致性。运动感知调制进一步注入跨帧变化线索,突出动态变化区域。基于 Mamba 的时序聚合随后建模跨帧的类别条件相似性模式演化。通过保持稠密视觉-文本对应,SimVA 有效地将 CLIP 迁移到视频动作识别,实现了在 zero-shot、few-shot 和 base-to-novel 测试集上的竞争性能。

关键词

引用

@article{arxiv.2605.23288,
  title  = {Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition},
  author = {Yerim So and Jiyeong Kim and Jiwon Yoon and Dongbo Min},
  journal= {arXiv preprint arXiv:2605.23288},
  year   = {2026}
}