弥合骨骼-文本模态鸿沟:扩散驱动的模态对齐用于零样本骨骼动作识别
计算机视觉与模式识别
2025-07-17 v4
摘要
在零样本骨骼动作识别(ZSAR)中,将骨骼特征与动作标签的文本特征对齐对于准确预测未见动作至关重要。ZSAR 面临弥合这两类特征间模态鸿沟的根本挑战,这严重限制了对未见动作的泛化能力。以往方法专注于骨骼与文本潜在空间的直接对齐,但这些空间间的模态鸿沟阻碍了鲁棒的泛化学习。受扩散模型在多模态对齐(如文本到图像、文本到视频)中成功的启发,我们首次提出了一种基于扩散的骨骼-文本对齐框架用于 ZSAR。我们的方法,即用于骨骼-文本匹配的三元组扩散(TDSM),侧重于扩散模型的跨模态对齐能力而非其生成能力。具体而言,TDSM 通过将文本特征融入反向扩散过程,将骨骼特征与文本提示对齐,在文本引导下对骨骼特征进行去噪,形成统一的骨骼-文本潜在空间以实现鲁棒匹配。为增强判别能力,我们引入三元组扩散(TD)损失,鼓励 TDSM 修正骨骼-文本匹配,同时将不同动作类别的匹配推开。我们的 TDSM 以 2.36% 到 13.05% 的显著优势大幅超越最新的最先进方法,展示了通过有效的骨骼-文本匹配在零样本设置下的卓越准确性和可扩展性。
引用
@article{arxiv.2411.10745,
title = {Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition},
author = {Jeonghyeok Do and Munchurl Kim},
journal= {arXiv preprint arXiv:2411.10745},
year = {2025}
}
备注
ICCV 2025 (camera-ready version). Please visit our project page at https://kaist-viclab.github.io/TDSM_site/