保持表情的人脸正面化改进视觉辅助语音处理
计算机视觉与模式识别
2023-11-21 v4 声音
音频与语音处理
摘要
人脸正面化是指从任意视角的人脸合成正面视角的人脸。本文的主要贡献是一种保留非刚性面部形变的正面化方法,以提升视觉辅助语音通信的性能。该方法在(i)刚性变换(尺度、旋转和平移)与(ii)任意视角人脸和人脸模型之间的非刚性形变的估计之间交替进行。该方法有两个重要优点:它能处理数据中的非高斯误差,并且引入了动态人脸形变模型。为此,我们结合使用广义 Student t 分布与线性动态系统,以同时考虑刚性头部运动和由语音产生引起的时变面部形变。我们提出使用零均值归一化互相关(ZNCC)分数来评估该方法保留面部表情的能力。该方法被充分评估并与若干基于传统几何模型或深度学习的现有最优方法进行比较。此外,我们表明当该方法被纳入深度学习流水线,即唇读和语音增强时,可大幅提升词识别率和语音可懂度分数。补充材料见 https://team.inria.fr/robotlearn/research/facefrontalization/
引用
@article{arxiv.2204.02810,
title = {Expression-preserving face frontalization improves visually assisted speech processing},
author = {Zhiqi Kang and Mostafa Sadeghi and Radu Horaud and Xavier Alameda-Pineda},
journal= {arXiv preprint arXiv:2204.02810},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2202.00538