利用Whisper自动标注实现低标注量语言的视觉语音识别
计算机视觉与模式识别
2024-01-15 v2 人工智能
音频与语音处理
摘要
本文提出一种面向多种语言、尤其是标注数据有限的低资源语言的强大视觉语音识别(VSR)方法。不同于以往试图利用从其他语言学到的知识来提升目标语言VSR性能的方法,我们探索能否在无人工干预下增加各语言训练数据本身的数量。为此,我们采用可同时进行语言识别与基于音频的语音识别的Whisper模型。它用于筛选所需语言的数据,并从无标注的多语言音视频数据池中转录标签。通过比较使用自动标签与人工标注标签训练的VSR模型性能,我们表明即使不利用人工标注,也能达到与人工标注标签相似的VSR性能。通过自动标注流程,我们标注了大规模无标注多语言数据库VoxCeleb2和AVSpeech,为四种低VSR资源语言(法语、意大利语、西班牙语和葡萄牙语)生成了1002小时数据。借助自动标签,我们在mTEDx的四种语言上实现了新的最优性能,显著超越以往方法。自动标签已在线提供:https://github.com/JeongHun0716/Visual-Speech-Recognition-for-Low-Resource-Languages
引用
@article{arxiv.2309.08535,
title = {Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper},
author = {Jeong Hun Yeo and Minsu Kim and Shinji Watanabe and Yong Man Ro},
journal= {arXiv preprint arXiv:2309.08535},
year = {2024}
}
备注
Accepted at ICASSP 2024