中文

阿拉伯方言语境下的多模态辅音恢复:CATT-Whisper 模型

计算与语言 2025-10-29 v1

摘要

本文针对阿拉伯方言句子的辅音恢复(DR)任务,提出一种结合文本和语音信息的多模态方法。我们提出的模型对文本模态使用来自我们自训练模型 CATT 的编码器。语音组件由 OpenAI Whisper 基础模型的编码器模块处理。我们的解决方案遵循两种集成策略:前者在早期阶段融合语音标记,其中 1500 帧音频分段在 10 帧连续帧上平均,得到 150 个语音标记。为确保嵌入兼容性,这些平均标记通过线性投影层处理后与文本标记合并。通过 CATT 编码器模块保证上下文编码。后者策略依赖于跨注意力机制,文本和语音嵌入被融合。跨注意力输出随后输入到 CATT 分类头进行标记级辅音预测。为进一步提高模型鲁棒性,我们在训练期间随机停用语音输入,使模型能够在有或无语音的情况下表现良好。我们的实验表明,所提方法在开发集上实现了 0.25 的词错误率(WER)和 0.9 的字符错误率(CER)。在测试集上,本模型实现了 WER 和 CER 分别为 0.55 和 0.13。

关键词

引用

@article{arxiv.2510.24247,
  title  = {Abjad AI at NADI 2025: CATT-Whisper: Multimodal Diacritic Restoration Using Text and Speech Representations},
  author = {Ahmad Ghannam and Naif Alharthi and Faris Alasmary and Kholood Al Tabash and Shouq Sadah and Lahouari Ghouti},
  journal= {arXiv preprint arXiv:2510.24247},
  year   = {2025}
}