越南语自动语音识别:一次重新审视
计算与语言
2026-03-17 v1
摘要
自动语音识别(ASR)性能严重依赖于大规模高质量数据集的 availability。对于低资源语言,现有开源ASR数据集常常存在质量不足和标注不一致的问题,阻碍了鲁棒模型的开发。为此,我们提出一种新颖且可推广的用于构建高质量ASR数据集的数据聚合和预处理管道,旨在从多样化的、可能噪声较大的开源来源构建高质量数据集。我们的管道包含严格的处理步骤,以确保数据多样性、平衡性以及包括关键特征如单词级时间戳的完整性。我们通过将其应用于越南语,演示了该方法的有效性, resulting in 一个统一的、高质量的500小时数据集,为训练和评估最先进的越南语ASR系统提供了基础。我们的项目页面位于 https://github.com/qualcomm-ai-research/PhoASR。
引用
@article{arxiv.2603.14779,
title = {Vietnamese Automatic Speech Recognition: A Revisit},
author = {Thi Vu and Linh The Nguyen and Dat Quoc Nguyen},
journal= {arXiv preprint arXiv:2603.14779},
year = {2026}
}
备注
Accepted to EACL 2026 Findings