基于稀疏语义编码的开放词汇动作识别的时空相似性体积聚合
计算机视觉与模式识别
2026-05-25 v1
摘要
近期的开放词汇动作识别(OVAR)方法通常在计算文本对齐前将视觉特征聚合为全局表示,这会遮蔽局部 patch 信息和细粒度时空线索。我们提出 Similarity Volume Aggregation (SimVA),构建稠密 4D 时空相似性体积的框架,从 patch 级视觉-文本相似性出发。SimVA 在局部视频标记和动作类别之间构建时空相似性体积,并通过类别采样确保相似性聚合可扩展至大型词汇表。相似性体积经空间聚合细化,语境化局部相似模式以提高帧内一致性。运动感知调制进一步注入跨帧变化线索,突出动态变化区域。基于 Mamba 的时序聚合随后建模跨帧的类别条件相似性模式演化。通过保持稠密视觉-文本对应,SimVA 有效地将 CLIP 迁移到视频动作识别,实现了在 zero-shot、few-shot 和 base-to-novel 测试集上的竞争性能。
引用
@article{arxiv.2605.23288,
title = {Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition},
author = {Yerim So and Jiyeong Kim and Jiwon Yoon and Dongbo Min},
journal= {arXiv preprint arXiv:2605.23288},
year = {2026}
}