中文

Balalaika:面向俄语语音的数据中心型韵律感知标注流水线

计算与语言 2026-05-05 v2 声音 音频与语音处理

摘要

我们介绍了Balalaika,一个开源的、数据中心型的音频处理与韵律感知标注流水线。它结合了用于保留上下文的语义VAD分割、带有ROVER共识解码的多ASR集成(同时保留可选的词级时间戳),以及随后的自动质量和说话人纯度过滤。文本进一步通过标点恢复、词汇重音和“\textipa{e}/\textipa{\H{e}}”归一化以及IPA音素进行丰富。利用Balalaika,我们构建了一个包含丰富标注的5.1k小时多源俄语语料库,并在均衡训练预算下,在语音去噪和TTS任务中均展示了一致的性能提升;消融实验证实了重音和标点的互补效益,以及通过更严格的MOS过滤实现的合成质量改进。数据集已在\href{https://huggingface.co/collections/lab260/balalaika-dataset}{\underline{\textbf{HuggingFace}}}上公开。

关键词

引用

@article{arxiv.2507.13563,
  title  = {Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech},
  author = {Kirill Borodin and Nikita Vasiliev and Vasiliy Kudryavtsev and Maxim Maslov and Mikhail Gorodnichev and Grach Mkrtchian},
  journal= {arXiv preprint arXiv:2507.13563},
  year   = {2026}
}

备注

The work is still in progress. Submitted to Interspeech 2026