中文

来自议会记录的自动生成语音和文本数据集:ParlaSpeech 集合

音频与语音处理 2025-03-17 v2 计算与语言 机器学习 声音

摘要

近期的语音和语言技术取得了显著进步,这些进步既来自对原始语言数据进行的自监督方法,也来自各种类型的显式监督。为了确保语音数据的高质量处理,最有用的显式监督仍然是语音信号与其对应文本转录之间的对齐,这种数据类型在许多语言中并不可得。在本文中,我们提出了构建大规模开放语音和文本对齐数据集的方法,这些数据集基于议会记录的转录及其录音。我们的起点是来自26个欧洲国家议会的ParlaMint可比语料库。我们专注于三个斯拉夫语言——克罗地亚语、波兰语和塞尔维亚语——通过对齐公开可用的录音来扩展ParlaMint语料库。我们方法的主要挑战是ParlaMint文本与可用录音之间缺乏全局对齐,以及各模态数据顺序的时有差异,这需要一种新颖的方法来对齐大范围的文本和音频序列。本次试点运行的结果是三个高质�的数据集,涵盖超过5000小时的语音及其对应的文本转录。尽管这些数据集已经在这三个语言的语音和文本数据的可用性方面取得了巨大进步,但我们强调所提出方法在为许多其他语言构建类似数据集方面的潜力。

关键词

引用

@article{arxiv.2409.15397,
  title  = {The ParlaSpeech Collection of Automatically Generated Speech and Text Datasets from Parliamentary Proceedings},
  author = {Nikola Ljubešić and Peter Rupnik and Danijel Koržinek},
  journal= {arXiv preprint arXiv:2409.15397},
  year   = {2025}
}

备注

Submitted to SPECOM 2024