中文

ManWav:首个满族语自动语音识别模型

计算与语言 2024-06-21 v1 声音 音频与语音处理

摘要

本研究聚焦于自动语音识别(ASR)领域中高资源语言与极低资源语言之间的鸿沟,特别关注被严重濒危的满族语。满族语体现了边缘语言社区获取前沿技术面临的挑战。我们首次引入了首个满族语ASR模型ManWav,基于Wav2Vec2-XLSR-53。实验结果令人鼓舞,尤其是在使用我们增强数据训练后。与使用原始数据的相同基础模型相比,Wav2Vec2-XLSR-53在使用增强数据微调后,错误率(CER)下降0.02,词错误率(WER)下降0.13。

关键词

引用

@article{arxiv.2406.13502,
  title  = {ManWav: The First Manchu ASR Model},
  author = {Jean Seo and Minha Kang and Sungjoo Byun and Sangah Lee},
  journal= {arXiv preprint arXiv:2406.13502},
  year   = {2024}
}

备注

ACL2024/Field Matters