Thaka在KSAA-2026任务2中的表现:用于阿拉伯语音频变音符号化的正则化微调
计算与语言
2026-05-26 v1 声音
音频与语音处理
摘要
我们描述了KSAA-2026自动变音符号化阿拉伯语音频听写共享任务中任务2的获胜系统。该任务要求从语音音频和未加变音符号的转录文本中生成完全变音符号化的阿拉伯语文本,仅提供2,327个训练样本,且不允许使用外部数据。我们的系统对CATT-Whisper进行了微调,这是一种字符级多模态模型,结合了预训练的CATT文本编码器和冻结的Whisper语音编码器。我们方法的关键在于训练正则化:R-Drop一致性正则化、Optuna优化的高权重衰减超参数以及Focal Loss。在推理时,我们使用蒙特卡洛Dropout在softmax概率级别对四个模型检查点的200次随机前向传递结果进行平均。该系统在主要排行榜指标(含格尾,包括无变音符号位置)上实现了23.26%的词错误率(WER),在所有参与者中排名第一。
引用
@article{arxiv.2605.25928,
title = {Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization},
author = {Meshal Alamr and Hassan Alqaeri and Abdullah Aldahlawi},
journal= {arXiv preprint arXiv:2605.25928},
year = {2026}
}
备注
4 pages, 1 figure. Published in Proceedings of OSACT7 (LREC 2026). Winning system for KSAA-2026 Task 2 on Arabic Speech Diacritization