通过视听信息融合改进语音相关面部动作单元识别
计算机视觉与模式识别
2017-07-03 v1
摘要
从自发表情中识别面部动作单元(AU)具有挑战性,尤其当伴有语音时。主要原因是在当前实践中信息仅从单一来源(即视觉通道)提取。然而,在自然人类交流中面部活动与语音高度相关。本文未仅致力于改进视觉观测,而是提出一种新颖的视听融合框架,在识别语音相关面部 AU 时充分利用视觉与听觉线索。具体地,采用动态贝叶斯网络(DBN)显式建模 AU 与音素之间语义及动态的生理关系以及测量不确定性。我们收集了一个试点视听 AU 编码数据库来评估所提框架,该数据库包含一个在良好控制条件下正面人脸的“干净”子集,以及一个具有大幅头部运动和遮挡的挑战性子集。在该数据库上的实验表明,与最先进的基于视觉的方法相比,所提框架在识别语音相关 AU 方面取得显著改进,特别是对于那些在说话时视觉观测受损的 AU;更重要的是,通过显式建模并利用 AU 与音素间的生理关系,其性能也优于特征级融合方法。
引用
@article{arxiv.1706.10197,
title = {Improving Speech Related Facial Action Unit Recognition by Audiovisual Information Fusion},
author = {Zibo Meng and Shizhong Han and Ping Liu and Yan Tong},
journal= {arXiv preprint arXiv:1706.10197},
year = {2017}
}
备注
arXiv admin note: text overlap with arXiv:1706.07536