ASR即所需:面向唇读的跨模态蒸馏
计算机视觉与模式识别
2020-04-01 v2 声音
音频与语音处理
摘要
本工作的目标是在无需人工标注真值数据的情况下训练视觉语音识别的强模型。我们通过从一个在大规模纯音频语料上训练的自适应语音识别(ASR)模型进行蒸馏来实现这一点。我们采用一种结合连接主义时序分类(CTC)与逐帧交叉熵损失的跨模态蒸馏方法。我们的贡献有四点:(i)我们表明训练唇读系统无需真值转写文本;(ii)我们展示了如何利用任意数量的未标注视频数据来提升性能;(iii)我们证明蒸馏显著加速了训练;以及(iv)我们在仅使用公开可用数据训练的具有挑战性的LRS2和LRS3数据集上取得了最先进(SOTA)结果。
引用
@article{arxiv.1911.12747,
title = {ASR is all you need: cross-modal distillation for lip reading},
author = {Triantafyllos Afouras and Joon Son Chung and Andrew Zisserman},
journal= {arXiv preprint arXiv:1911.12747},
year = {2020}
}
备注
ICASSP 2020