ManWav:首个满族语自动语音识别模型
计算与语言
2024-06-21 v1 声音
音频与语音处理
摘要
本研究聚焦于自动语音识别(ASR)领域中高资源语言与极低资源语言之间的鸿沟,特别关注被严重濒危的满族语。满族语体现了边缘语言社区获取前沿技术面临的挑战。我们首次引入了首个满族语ASR模型ManWav,基于Wav2Vec2-XLSR-53。实验结果令人鼓舞,尤其是在使用我们增强数据训练后。与使用原始数据的相同基础模型相比,Wav2Vec2-XLSR-53在使用增强数据微调后,错误率(CER)下降0.02,词错误率(WER)下降0.13。
引用
@article{arxiv.2406.13502,
title = {ManWav: The First Manchu ASR Model},
author = {Jean Seo and Minha Kang and Sungjoo Byun and Sangah Lee},
journal= {arXiv preprint arXiv:2406.13502},
year = {2024}
}
备注
ACL2024/Field Matters