Thaka在KSAA-2026任务2:面向阿拉伯语语音加词的正则化微调
数据结构与算法
2026-05-26 v1 最优化与控制
摘要
我们描述了在KSAA-2026共享任务任务2中获胜的系统。该任务要求从语音音频和未加词的转录文本中生成完全加词的阿拉伯语文本,仅提供2,327个训练样本且禁止使用外部数据。我们的系统对CATT-Whisper进行微调,这是一个结合预训练CATT文本编码器与冻结Whisper语音编码器的字符级多模态模型。我们方法的关键在于训练正则化:采用R-Drop一致性正则化、Optuna优化的超参数(高权重衰减)和Focal Loss。推理时,我们在四个模型检查点上进行200次随机前向传播,并在softmax概率水平上使用蒙特卡罗 Dropout进行平均。该系统在主要排行榜指标上实现了23.26%的错误识别率(WER),其中包括带有词尾的情形(包括无词的情形),位居所有参赛者之首。
引用
@article{arxiv.2605.25927,
title = {On the Complexity of Bilevel Independent Set Problem},
author = {Komal Muluk},
journal= {arXiv preprint arXiv:2605.25927},
year = {2026}
}