中文

越南语自动语音识别:一次重新审视

计算与语言 2026-03-17 v1

摘要

自动语音识别(ASR)性能严重依赖于大规模高质量数据集的 availability。对于低资源语言,现有开源ASR数据集常常存在质量不足和标注不一致的问题,阻碍了鲁棒模型的开发。为此,我们提出一种新颖且可推广的用于构建高质量ASR数据集的数据聚合和预处理管道,旨在从多样化的、可能噪声较大的开源来源构建高质量数据集。我们的管道包含严格的处理步骤,以确保数据多样性、平衡性以及包括关键特征如单词级时间戳的完整性。我们通过将其应用于越南语,演示了该方法的有效性, resulting in 一个统一的、高质量的500小时数据集,为训练和评估最先进的越南语ASR系统提供了基础。我们的项目页面位于 https://github.com/qualcomm-ai-research/PhoASR。

关键词

引用

@article{arxiv.2603.14779,
  title  = {Vietnamese Automatic Speech Recognition: A Revisit},
  author = {Thi Vu and Linh The Nguyen and Dat Quoc Nguyen},
  journal= {arXiv preprint arXiv:2603.14779},
  year   = {2026}
}

备注

Accepted to EACL 2026 Findings