中文

唇部感兴趣区域是否足以进行唇读?

计算机视觉与模式识别 2022-06-03 v2 音频与语音处理

摘要

唇部感兴趣区域(ROI)传统上被用作唇读任务中的视觉输入。很少有工作采用整张人脸作为视觉输入,因为通常认为面部除嘴唇外的部分冗余且与视觉语音识别无关。然而,人脸包含比嘴唇更丰富的细节信息,如说话人的头部姿态、情绪、身份等。我们认为,如果训练一个使用整张人脸的强大特征提取器,此类信息可能有益于视觉语音识别。在本工作中,我们提出采用整张人脸并结合自监督学习进行唇读。我们的实验中采用了AV-HuBERT,一个音视频多模态自监督学习框架。实验结果表明,与使用唇部作为视觉输入的基线方法相比,采用整张人脸在唇读任务上实现了16%的相对词错误率(WER)降低。在没有自监督预训练的情况下,在有限训练数据(30小时)时,使用人脸输入的模型比使用唇部输入的模型WER更高,而在使用大量训练数据(433小时)时WER略低。

关键词

引用

@article{arxiv.2205.14295,
  title  = {Is Lip Region-of-Interest Sufficient for Lipreading?},
  author = {Jing-Xuan Zhang and Gen-Shun Wan and Jia Pan},
  journal= {arXiv preprint arXiv:2205.14295},
  year   = {2022}
}

备注

preprint