用于文本无关说话人识别的三维唇动网络
计算机视觉与模式识别
2020-10-14 v1
摘要
唇动反映说话人的行为特征,因此可用作说话人识别中的一种新型生物特征。已有大量工作利用二维(2D)唇部图像在文本相关场景下识别说话人。然而,2D 唇部易受各种人脸朝向影响。为此,本文提出一种新颖的端到端三维唇动网络(3D Lip motion Network, 3LMNet),利用句子级三维唇动(sentence-level 3D lip motion, S3DLM)在文本无关与文本相关场景下识别说话人。我们提出一种新的区域反馈模块(Regional Feedback Module, RFM)以获取不同唇部区域的注意力。此外,研究唇动先验知识以补充 RFM,将关键点级与帧级特征融合形成更好的特征表示。我们还提出坐标变换与人脸姿态校正两种方法来预处理 LSD-AV 数据集,该数据集包含 68 名说话人,每人 146 句话。在该数据集上的评估结果表明,我们所提 3LMNet 优于基线模型(即 LSTM、VGG-16 与 ResNet-34),并超越使用 2D 唇部图像及 3D 人脸的当前最优方法。本工作代码发布于 https://github.com/wutong18/Three-Dimensional-Lip-Motion-Network-for-Text-Independent-Speaker-Recognition。
引用
@article{arxiv.2010.06363,
title = {Three-Dimensional Lip Motion Network for Text-Independent Speaker Recognition},
author = {Jianrong Wang and Tong Wu and Shanyu Wang and Mei Yu and Qiang Fang and Ju Zhang and Li Liu},
journal= {arXiv preprint arXiv:2010.06363},
year = {2020}
}