基于视觉注意力的子词级唇读
计算机视觉与模式识别
2021-12-06 v2 计算与语言
摘要
本文的目标是学习强大的唇读模型,能够识别无声视频中的语音。大多数先前的工作通过将现有的自动语音识别技术应用于简单池化的视觉特征之上,来处理开放集视觉语音识别问题。相反,在本文中,我们专注于唇读中遇到的独特挑战,并提出了量身定制的解决方案。为此,我们做出了以下贡献:(1)我们提出了一种基于注意力的池化机制来聚合视觉语音表征;(2)我们首次将子词单元用于唇读,并表明这使我们能够更好地建模该任务的歧义性;(3)我们提出了一个在唇读网络之上训练的视觉语音检测(VSD)模型。遵循上述方法,我们在使用公开数据集训练时,在具有挑战性的 LRS2 和 LRS3 基准上取得了最先进的结果,甚至在使用少一个数量级数据的情况下,超越了在大规模工业数据集上训练的模型。我们的最佳模型在 LRS2 数据集上实现了 22.6% 的词错误率,这是唇读模型前所未有的性能,显著缩小了唇读与自动语音识别之间的性能差距。此外,在 AVA-ActiveSpeaker 基准上,我们的 VSD 模型超越了所有纯视觉基线,甚至优于几种最近的视听方法。
引用
@article{arxiv.2110.07603,
title = {Sub-word Level Lip Reading With Visual Attention},
author = {K R Prajwal and Triantafyllos Afouras and Andrew Zisserman},
journal= {arXiv preprint arXiv:2110.07603},
year = {2021}
}