中文

LEMAS:大规模可扩展多语言音频套件

声音 2026-01-09 v1 音频与语音处理

摘要

我们提出LEMAS数据集,据称目前规模最大的开源多语言语音语料库,包含逐词时间戳。LEMAS数据集覆盖超过15万小时,涵盖10种主要语言,LEMAS数据集通过一种高效的数据处理管道构建,确保数据和标注的高质量。为验证LEMAS数据集在多样化生成范例中的有效性,我们在此数据集上训练了两个具有不同架构和任务专长的基准模型。LEMAS-TTS基于非自回归流匹配框架,利用数据集的大规模和语言多样性实现了稳健的零样多语言合成。我们提出的变音对抗训练和CTC损失缓解了跨语言变音问题,增强了合成稳定性。补充方面,LEMAS-Edit采用自回归解码器-only架构,将语音编辑表述为掩码标记填充任务。通过利用精确的逐词对齐来构建训练掩码并采用自适应解码策略,它实现了无缝、平滑边界语音编辑,具有自然的过渡。实验结果表明,在LEMAS数据集上训练的模型交付了高质量的合成和编辑性能,确认了数据集的质量。我们设想,这一富含精确时间戳、细粒度多语言语料库将推动未来基于提示的语音生成系统的进展。

关键词

引用

@article{arxiv.2601.04233,
  title  = {LEMAS: Large A 150K-Hour Large-scale Extensible Multilingual Audio Suite with Generative Speech Models},
  author = {Zhiyuan Zhao and Lijian Lin and Ye Zhu and Kai Xie and Yunfei Liu and Yu Li},
  journal= {arXiv preprint arXiv:2601.04233},
  year   = {2026}
}

备注

Demo page: https://lemas-project.github.io/LEMAS-Project