基于序列建模的自然环境下表情识别
音频与语音处理
2020-03-03 v1 声音
摘要
随着我们在建模行为不同方面的过程上取得进展,表情识别已成为人机交互中的关键研究领域。自然环境下的表情识别是一个非常有趣且具挑战性的问题,因为它涉及细致的特征提取和大量计算。本文介绍了我们在 ABAW 竞赛中针对 Aff-Wild2 数据库识别不同表情(即中性、愤怒、厌恶、恐惧、高兴、悲伤、惊讶)所贡献使用的方法与技术。Aff-Wild2 数据库包含在帧级别标注了七种不同表情的自然环境视频。我们采用双模态方法融合音频与视觉特征,并训练了一个基于门控循环单元(GRU)和长短期记忆(LSTM)网络的序列到序列模型。我们展示了在验证数据上的实验结果。所提方法的总体准确率为 41.5%,优于 37% 的竞赛基线。
引用
@article{arxiv.2003.00170,
title = {Expression Recognition in the Wild Using Sequence Modeling},
author = {Sowmya Rasipuram and Junaid Hamid Bhat and Anutosh Maitra},
journal= {arXiv preprint arXiv:2003.00170},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:2002.12766