中文

AraS2P:阿拉伯语语音到音素系统

计算与语言 2025-09-30 v1

摘要

本文描述了AraS2P,我们提交至Iqra'Eval 2025共享任务的语音到音素系统。我们通过两阶段训练策略适配了Wav2Vec2-BERT。在第一阶段,在大规模阿拉伯语语音-音素数据集上进行了任务自适应继续预训练,这些数据集是通过使用MSA音素化器将阿拉伯语文本转换生成的。在第二阶段,模型在官方共享任务数据上进行了微调,并通过XTTS-v2合成的诵读数据进行了额外增强,这些数据包含多样的经文片段、说话人嵌入和文本扰动,以模拟可能的人类错误。该系统在官方排行榜上排名第一,证明音素感知预训练结合针对性增强在音素级发音错误检测方面具有显著优势。

关键词

引用

@article{arxiv.2509.23504,
  title  = {AraS2P: Arabic Speech-to-Phonemes System},
  author = {Bassam Matar and Mohamed Fayed and Ayman Khalafallah},
  journal= {arXiv preprint arXiv:2509.23504},
  year   = {2025}
}