CLIP-MG:基于骨架姿态特征和 RGB 数据引导语义注意力的微动作识别
计算机视觉与模式识别
2025-06-23 v1 人工智能
机器学习
摘要
微动作识别是情感计算中的一个具有挑战性的任务,由于其微妙的、不自主的性质以及低位移幅度。本文提出了一种基于姿态引导的语义感知 CLIP 架构,或称为 CLIP for Micro-Gesture recognition (CLIP-MG),是为微动作分类定制的 CLIP 模型变体,适用于 iMiGUE 数据集。CLIP-MG 通过姿态引导语义查询生成和门控多模态融合机制将人类姿态(骨架)信息整合到 CLIP 基于识别的管道中。所提出的模型实现了 61.82% 的 Top-1 准确率。这些结果既展示了我们方法的潜力,也表明在完全适配用于微动作识别的视觉语言模型如 CLIP 方面仍存在剩余难度。
引用
@article{arxiv.2506.16385,
title = {CLIP-MG: Guiding Semantic Attention with Skeletal Pose Features and RGB Data for Micro-Gesture Recognition on the iMiGUE Dataset},
author = {Santosh Patapati and Trisanth Srinivasan and Amith Adiraju},
journal= {arXiv preprint arXiv:2506.16385},
year = {2025}
}