Tagarela - 一个来自播客的葡萄牙语语音数据集
计算与语言
2026-03-17 v1 人工智能
摘要
尽管语音处理领域取得了显著进展,但葡萄牙语因缺乏公开的大规模高质量数据集而资源匮乏。为弥合这一差距,我们提出了一个新数据集,名为TAGARELA,包含超过8,972小时的播客音频,专为训练自动语音识别(ASR)和文本转语音(TTS)模型而精选。其规模与英语的GigaSpeech(10,000小时)相当,可实现最先进的葡萄牙语模型。为确保数据质量,该语料库经历了音频预处理流程,并采用混合策略进行转录:我们应用了先前在高保真转录(由专有API生成)上训练的ASR模型,确保了较高的初始准确性。最后,我们训练并评估了仅使用本数据集的ASR和TTS模型,展示了其在提升葡萄牙语语音技术健壮性和自然性方面的潜力。该数据集已公开发布,地址为https://freds0.github.io/TAGARELA/,旨在推动健壮语音技术的发展。
引用
@article{arxiv.2603.15326,
title = {Tagarela - A Portuguese speech dataset from podcasts},
author = {Frederico Santos de Oliveira and Lucas Rafael Stefanel Gris and Alef Iury Siqueira Ferreira and Augusto Seben da Rosa and Alexandre Costa Ferro Filho and Edresson Casanova and Christopher Dane Shulby and Rafael Teixeira Sousa and Diogo Fernandes Costa Silva and Anderson da Silva Soares and Arlindo Rodrigues Galvão Filho},
journal= {arXiv preprint arXiv:2603.15326},
year = {2026}
}