塞佩迪语-英语语码转换自动语音识别系统评估
音频与语音处理
2024-03-14 v1 计算与语言
机器学习
摘要
语音技术是一个涵盖多种技术和工具的领域,用于使机器能够与语音交互,例如自动语音识别(ASR)、口语对话系统等,允许设备通过麦克风从人类说话者捕捉口语词汇。端到端方法,如连接时序分类(CTC)和基于注意力的方法,是开发ASR系统最常用的方法。然而,这些技术通常用于研究和开发许多拥有大量语音数据用于训练和评估的高资源语言,导致低资源语言相对发展不足。虽然 CTC 方法已成功用于其他语言,但其对塞佩迪语的有效性仍不确定。在本研究中,我们呈现了对塞佩迪语-英语语码转换自动语音识别系统的评估。该端到端系统使用塞佩迪语提示语码转换语料库和 CTC 方法开发。系统性能使用 NCHLT 塞佩迪语测试语料库和塞佩迪语提示语码转换语料库进行评估。该模型产生了 41.9% 的最低词错误率(WER),然而,该模型在识别纯塞佩迪语文本时面临挑战。
引用
@article{arxiv.2403.07947,
title = {The evaluation of a code-switched Sepedi-English automatic speech recognition system},
author = {Amanda Phaladi and Thipe Modipa},
journal= {arXiv preprint arXiv:2403.07947},
year = {2024}
}
备注
13 pages,2 figures,2nd International Conference on NLP & AI (NLPAI 2024)