用于头部姿态与细粒度手势识别的区域注意力网络(RAN)
计算机视觉与模式识别
2021-01-19 v1 人工智能
机器学习
摘要
情感常通过动作/手势等非语言身体语言来表达,而这些是人的行为的重要指示。近期关于单目图像中细粒度动作/手势识别的研究主要集中于建模代表身体姿态、人-物交互以及局部外观变化的身体部位空间配置。结果表明这是一种脆弱的方法,因为它依赖于准确的身体部位/物体检测。在本工作中,我们认为存在局部判别性语义区域,其“信息量”可通过注意力机制来评估以推断细粒度手势/动作。为此,我们提出了一种新颖的端到端区域注意力网络(RAN),它是一个全卷积神经网络(CNN),通过注意力机制组合多个上下文区域,聚焦于与给定任务最相关的图像部分。我们的区域由一个或多个连续单元组成,并改编自计算 HOG(方向梯度直方图)描述子时所用的策略。该模型在属于 3 种不同场景的十个数据集上进行了广泛评估:1)头部姿态识别,2)驾驶员状态识别,以及 3)人体动作与面部表情识别。所提出的方法在不同指标上以可观的幅度优于当前最优方法。
引用
@article{arxiv.2101.06634,
title = {Regional Attention Network (RAN) for Head Pose and Fine-grained Gesture Recognition},
author = {Ardhendu Behera and Zachary Wharton and Morteza Ghahremani and Swagat Kumar and Nik Bessis},
journal= {arXiv preprint arXiv:2101.06634},
year = {2021}
}
备注
This manuscript is the accepted version of the published paper in IEEE Transaction on Affective Computing