CrossGLG:LLM 以跨层级方式引导的一次性基于骨架的 3D 动作识别
计算机视觉与模式识别
2024-03-18 v1
摘要
现有的大多数一次性基于骨架的动作识别关注原始低层信息(例如关节位置),可能面临局部信息丢失和泛化能力低的问题。为了缓解这些问题,我们提出利用大型语言模型(LLM)生成的包含高级人类知识的文本描述,以全局-局部-全局的方式指导特征学习。具体而言,在训练期间,我们设计了 个提示从 LLM 获取每个动作的全局和局部文本描述。我们首先利用全局文本描述指导骨架编码器聚焦于信息丰富的关节(即全局到局部)。然后我们在局部文本和关节特征之间建立非局部交互,以形成最终的全局表示(即局部到全局)。为了缓解训练和推理阶段之间的不对称问题,我们进一步设计了一种双分支架构,使模型能够在没有任何文本输入的情况下进行新类推理,同时也使得与基础骨架编码器相比,额外的推理成本可以忽略不计。在三个不同基准上的广泛实验表明,CrossGLG 始终以大幅优势优于现有的 SOTA 方法,且推理成本(模型大小)仅为先前 SOTA 的 %。CrossGLG 还可以作为即插即用模块,在推理期间以可忽略的成本大幅增强不同 SOTA 骨架编码器的性能。源代码即将发布。
引用
@article{arxiv.2403.10082,
title = {CrossGLG: LLM Guides One-shot Skeleton-based 3D Action Recognition in a Cross-level Manner},
author = {Tingbing Yan and Wenzheng Zeng and Yang Xiao and Xingyu Tong and Bo Tan and Zhiwen Fang and Zhiguo Cao and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2403.10082},
year = {2024}
}