中文

CoCoDiff:通过粗粒细文本共指潜在扩散实现骨架动作特征多样化

计算机视觉与模式识别 2025-05-01 v1

摘要

在动作识别任务中,特征多样性对于增强模型的泛化能力和性能至关重要。现有方法通常通过扩充训练数据的样本空间来促进特征多样性,往往导致效率低下和语义不一致。为克服这些问题,我们提出一种新型粗粒细文本共指扩散模型(Coarse-fine text co-guidance Diffusion model, CoCoDiff)。CoCoDiff 通过利用扩散和多粒度文本指导,在潜在空间中生成具有多样性且语义一致的特征。具体而言,我们的方法将从骨架序列中提取的时空特征输入到潜在扩散模型中,以生成多样化的动作表示。同时,我们引入粗粒细文本共指策略,利用大型语言模型(LLM)的文本信息,确保生成特征与原始输入之间的语义一致性。值得注意的是,CoCoDiff 可作为训练时的即插即用辅助模块,无需额外推理成本。广泛的实验表明,CoCoDiff 在基于骨架的动作识别基准数据集上实现了SOTA性能,包括NTU RGB+D、NTU RGB+D 120和Kinetics-Skeleton。

关键词

引用

@article{arxiv.2504.21266,
  title  = {CoCoDiff: Diversifying Skeleton Action Features via Coarse-Fine Text-Co-Guided Latent Diffusion},
  author = {Zhifu Zhao and Hanyang Hua and Jianan Li and Shaoxin Wu and Fu Li and Yangtao Zhou and Yang Li},
  journal= {arXiv preprint arXiv:2504.21266},
  year   = {2025}
}