语言知识辅助的基于骨架的动作识别表示学习
计算机视觉与模式识别
2023-05-23 v1
摘要
人类如何理解并识别他人动作是一个复杂的神经科学问题,涉及认知机制与神经网络的结合。研究表明,人类拥有识别动作并处理自上而下注意信息(如颞顶联合区)的脑区。此外,人类拥有专门理解他人心智并分析其意图的脑区,如颞叶内侧前额叶皮层。基于骨架的动作识别为人类骨架运动模式与行为之间的复杂联系建立映射。尽管现有研究编码了有意义的节点关系并合成动作表示用于分类且取得了良好效果,但极少有研究考虑引入先验知识以辅助潜在的表示学习从而提升性能。LA-GCN提出了一种利用大规模语言模型(LLM)知识辅助的图卷积网络。首先,将LLM知识映射为节点间的先验全局关系(GPR)拓扑与先验类别关系(CPR)拓扑。GPR引导生成新的“骨骼”表示,旨在从数据层面强调关键节点信息。CPR映射模拟人脑区域的类别先验知识,由PC-AC模块编码并用于添加额外监督,迫使模型学习类可区分特征。此外,为提升拓扑建模中的信息传递效率,我们提出了多跳注意力图卷积,它同时聚合每个节点的k阶邻域以加速模型收敛。LA-GCN在NTU RGB+D、NTU RGB+D 120和NW-UCLA数据集上达到了最先进水平。
引用
@article{arxiv.2305.12398,
title = {Language Knowledge-Assisted Representation Learning for Skeleton-Based Action Recognition},
author = {Haojun Xu and Yan Gao and Zheng Hui and Jie Li and Xinbo Gao},
journal= {arXiv preprint arXiv:2305.12398},
year = {2023}
}
备注
first upload with 13 pages and 8 figures