中文

用于面部表情与动作识别的形状轨迹稀疏编码

计算机视觉与模式识别 2019-08-12 v1

摘要

由于廉价 RGB-D 传感器的普及,视频流中人体标志点的检测与跟踪可靠性有所提升。此类时变几何数据的分析在自动理解人类行为中发挥着重要作用。然而,合适的形状表示及其时间演化(称为轨迹)通常位于非线性流形上。这在使用常规机器学习技术时增加了额外的约束(即非线性)。作为解决方案,本文采用著名的稀疏编码与字典学习方法,研究 Kendall 形状空间中 2D 与 3D 标志点的时变形状。我们展示了针对动作识别的 3D 骨骼序列以及针对宏观与微观表情识别的 2D 面部标志点序列的有效编码。为克服形状空间固有的非线性,我们探索了内蕴与外在解法。主要结果表明,形状轨迹产生了更具判别力的时间序列,并具备合适的计算特性,包括稀疏性与向量空间结构。在常用数据集上进行的大量实验证明了所提方法相较最先进(SOTA)方法的竞争力。

关键词

引用

@article{arxiv.1908.03231,
  title  = {Sparse Coding of Shape Trajectories for Facial Expression and Action Recognition},
  author = {Amor Ben Tanfous and Hassen Drira and Boulbaba Ben Amor},
  journal= {arXiv preprint arXiv:1908.03231},
  year   = {2019}
}

备注

14 pages, 5 figures