中文

基于序列建模的自然环境下表情识别

音频与语音处理 2020-03-03 v1 声音

摘要

随着我们在建模行为不同方面的过程上取得进展,表情识别已成为人机交互中的关键研究领域。自然环境下的表情识别是一个非常有趣且具挑战性的问题,因为它涉及细致的特征提取和大量计算。本文介绍了我们在 ABAW 竞赛中针对 Aff-Wild2 数据库识别不同表情(即中性、愤怒、厌恶、恐惧、高兴、悲伤、惊讶)所贡献使用的方法与技术。Aff-Wild2 数据库包含在帧级别标注了七种不同表情的自然环境视频。我们采用双模态方法融合音频与视觉特征,并训练了一个基于门控循环单元(GRU)和长短期记忆(LSTM)网络的序列到序列模型。我们展示了在验证数据上的实验结果。所提方法的总体准确率为 41.5%,优于 37% 的竞赛基线。

关键词

引用

@article{arxiv.2003.00170,
  title  = {Expression Recognition in the Wild Using Sequence Modeling},
  author = {Sowmya Rasipuram and Junaid Hamid Bhat and Anutosh Maitra},
  journal= {arXiv preprint arXiv:2003.00170},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:2002.12766