基于双重视觉-文本对齐的零样本骨架动作识别
计算机视觉与模式识别
2025-08-25 v2
摘要
零样本动作识别解决了动作识别中的可扩展性与泛化性问题,使模型能够动态适应新的未见动作,是计算机视觉领域的重要研究课题。零样本动作识别的关键在于将视觉特征与表示动作类别的语义向量进行对齐。现有大多数方法要么直接将视觉特征投影到文本类别的语义空间,要么在两种模态之间学习一个共享的嵌入空间。然而,直接投影无法准确对齐两种模态,且在视觉与文本表示之间学习鲁棒且具判别性的嵌入空间往往十分困难。为解决这些问题,我们引入了用于基于骨架的零样本动作识别的双重视觉-文本对齐(DVTA)。DVTA 由两个对齐模块——直接对齐(DA)与增强对齐(AA)——以及所设计的语义描述增强(SDE)组成。DA 模块通过专门设计的视觉投影器将骨架特征映射到语义空间,随后由基于交叉注意力的 SDE 增强骨架与文本之间的联系,从而缩小模态间的差距。AA 模块利用深度度量学习来学习骨架与文本之间的相似性,进一步加强了嵌入空间的学习。我们的方法在多个流行的基于骨架的零样本动作识别基准上取得了 state-of-the-art 的性能。代码获取自:https://github.com/jidongkuang/DVTA。
引用
@article{arxiv.2409.14336,
title = {Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment},
author = {Jidong Kuang and Hongsong Wang and Chaolei Han and Yang Zhang and Jie Gui},
journal= {arXiv preprint arXiv:2409.14336},
year = {2025}
}