AV-CPL:用于音视觉语音识别的连续伪标注方法
机器学习
2023-10-02 v1 声音
音频与语音处理
机器学习
摘要
音视觉语音包含同步的音频与视觉信息,为自动语音识别(ASR)与视觉语音识别(VSR)两者的表征学习提供跨模态监督。我们引入用于音视觉语音识别的连续伪标注(AV-CPL),一种半监督方法,用于在标注与未标注视频组合上训练音视觉语音识别(AVSR)模型,并使用连续再生成的伪标注。我们的模型针对来自音视觉输入的语音识别进行训练,并能够使用音频与视觉模态或仅单一模态进行语音识别。我们的方法对监督训练与伪标注生成使用同一音视觉模型,从而减轻了对外部语音识别模型生成伪标注的需求。AV-CPL 在 LRS3 数据集上取得 VSR 性能的显著提升,同时保持实用的 ASR 与 AVSR 性能。最后,利用纯视觉语音数据,我们的方法能够借助未标注视觉语音来改善 VSR。
引用
@article{arxiv.2309.17395,
title = {AV-CPL: Continuous Pseudo-Labeling for Audio-Visual Speech Recognition},
author = {Andrew Rouditchenko and Ronan Collobert and Tatiana Likhomanenko},
journal= {arXiv preprint arXiv:2309.17395},
year = {2023}
}
备注
Under review