基于频率-语义增强变分自编码器的零样态骨架动作识别
计算机视觉与模式识别
2025-06-30 v1 人工智能
摘要
零样态骨架动作识别旨在开发能够识别训练期未遇到的动作的模型。以往方法主要聚焦于对齐视觉与语义表征,常忽视语义空间中细粒度动作模式的重要性(例如,喝水和刷牙中手部动作的差异)。为此,我们提出了一种 Frequency-Semantic Enhanced Variational Autoencoder (FS-VAE) 以进行骨架语义表征学习并结合频率分解。FS-VAE 包含三个关键组件:1) 基于频率的增强模块,通过高频和低频调整丰富骨架语义学习并提高零样态动作识别的鲁棒性;2) 语义驱动的动作描述,采用多层次对齐捕获局部细节和全局对应关系,有效弥合语义差距并弥补骨架序列固有的损失;3) 校准的跨对齐损失,使有效的骨架-文本对能够抵消模糊的骨架-文本对,减轻骨架和文本特征之间的差异和歧义,从而确保稳健的对齐。在基准数据集上的评估表明,我们的方法有效,验证了频率增强语义特征能够鲁棒地区分视觉和语义上相似的动作簇,提高了零样态动作识别性能。
引用
@article{arxiv.2506.22179,
title = {Frequency-Semantic Enhanced Variational Autoencoder for Zero-Shot Skeleton-based Action Recognition},
author = {Wenhan Wu and Zhishuai Guo and Chen Chen and Hongfei Xue and Aidong Lu},
journal= {arXiv preprint arXiv:2506.22179},
year = {2025}
}
备注
Accepted to ICCV 2025