Conformer即你所需要的一切:用于视觉语音识别
机器学习
2023-12-14 v2 计算与语言
计算机视觉与模式识别
声音
音频与语音处理
摘要
视觉语音识别模型以分层方式提取视觉特征。在较低层级,有一个时间感受野有限的视觉前端,处理描绘嘴唇或面部的原始像素。在较高层级,有一个编码器,在较大时间感受野上关注前端产生的嵌入。先前工作聚焦于改进模型的视觉前端,以提取对语音识别更有用的特征。令人惊讶的是,我们的工作表明复杂的视觉前端并非必要。我们发现,将资源分配给线性视觉前端搭配更大的Conformer编码器,可带来更低延迟、更高效的内存使用以及改善的WER性能。我们在TED LRS3数据集上实现了视觉语音识别12.8% WER的新最先进水平,其可与四年前仅音频模型的性能相媲美。
引用
@article{arxiv.2302.10915,
title = {Conformers are All You Need for Visual Speech Recognition},
author = {Oscar Chang and Hank Liao and Dmitriy Serdyuk and Ankit Shah and Olivier Siohan},
journal= {arXiv preprint arXiv:2302.10915},
year = {2023}
}