中文

Bolbosh:面向 Kashmiri 文本转语音的脚本感知流匹配

计算与语言 2026-03-10 v1

摘要

Kashmiri 语言约有 700 万使用者,但在语音技术领域仍严重缺乏支持,尽管其拥有官方地位和丰富的语言遗产。缺乏稳健的文本转语音 (TTS) 系统限制了本土说话者的数字可访问性和包容性的人机交互。在本工作中,我们提出了首个专为 Kashmiri 语言设计的专用开源神经网络 TTS 系统。我们展示了,零样本多语言基线在印地语言上训练,因不足以建模波士阿拉字母音拱和语言特定的音位法则,仅能实现平均意见分数 (MOS) 为 1.86。为解决这些限制,我们提出了 Bolbosh,一种基于 Optimal Transport Conditional Flow Matching (OT-CFM) 的监督式跨语言适应策略,纳入 Matcha-TTS 框架中。这使我们能够在有限的配对数据下实现稳定的对齐。我们进一步引入一个三阶段声学增强管道,包括去回声、静音裁剪和音量归一化,以统一异构语音来源并稳定对齐学习。模型词汇表被扩展,以显式编码 Kashmiri grapheme,保留细粒度的元音区别。我们的系统实现了 MOS 为 3.63 和 Mel 语谱系数失真 (MCD) 为 3.73,显著优于多语言基线,建立了 Kashmiri 语音合成的新基准。我们的结果表明,脚本感知和监督式流式适应对于处理字符音拱敏感语言的低资源 TTS 至关重要。代码和数据均可在 https://github.com/gaash-lab/Bolbosh 提供。

关键词

引用

@article{arxiv.2603.07513,
  title  = {Bolbosh: Script-Aware Flow Matching for Kashmiri Text-to-Speech},
  author = {Tajamul Ashraf and Burhaan Rasheed Zargar and Saeed Abdul Muizz and Ifrah Mushtaq and Nazima Mehdi and Iqra Altaf Gillani and Aadil Amin Kak and Janibul Bashir},
  journal= {arXiv preprint arXiv:2603.07513},
  year   = {2026}
}

备注

https://gaash-lab.github.io/Bolbosh/