Habibi:为统一方言阿拉伯语语音合成奠定开源基础
计算与语言
2026-04-01 v2 声音
音频与语音处理
摘要
阿拉伯语包含超过 30 种口语变体,但尚无开源文本转语音系统能将其统一。主要障碍包括跨方言词汇和音系差异巨大、合成级数据稀缺,以及缺乏标准化的多方言评估基准。我们提出了 Habibi,一个统一方言的阿拉伯语 TTS 框架,旨在解决这三个问题。通过一个多步策展流水线,我们将开源 ASR 语料库重新用于覆盖 12 种以上地区方言的 TTS 训练数据。一种基于语言学信息的课程学习策略——从现代标准阿拉伯语逐步过渡到方言数据——使得无需文本变音符号即可实现稳健的零样本合成。我们进一步发布了首个标准化的多方言阿拉伯语 TTS 基准,包含超过 11,000 条话语,覆盖 7 个方言子集,并附有手动验证的转录文本。在该基准上,我们的统一模型匹配或超越了每种方言的专用模型。自动指标和人工评估均证实,Habibi 在清晰度、说话人相似度和自然度方面与 ElevenLabs 的 Eleven v3 (alpha) 极具竞争力。广泛的消融研究(约 8,000 H100 GPU 小时,30 多种配置)验证了每个设计选择。我们在 https://SWivid.github.io/Habibi/ 开源了所有检查点、训练和推理代码以及基准数据——这是多方言阿拉伯语 TTS 领域的首次此类发布。
引用
@article{arxiv.2601.13802,
title = {Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis},
author = {Yushen Chen and Junzhe Liu and Yujie Tu and Zhikang Niu and Yuzhe Liang and Chunyu Qiang and Chen Zhang and Kai Yu and Xie Chen},
journal= {arXiv preprint arXiv:2601.13802},
year = {2026}
}