基于CTC的阿拉伯方言识别用于流式应用
计算与语言
2026-01-21 v1
摘要
本文提出了一种受Connectionist Temporal Classification (CTC)损失函数启发的方言识别 (DID) 方法,后者用于自动语音识别 (ASR)。CTC-DID将方言识别任务框定为一个有限词汇的ASR系统,其中方言标签被视为给定语音片段的标签序列。在训练期间,语音片段中方言标签的重复次数可通过提出的语言无关启发式 (LAH) 方法或预训练ASR模型来估计。该方法在低资源阿拉伯方言识别 (ADI) 任务上进行了评估,实验结果表明,基于SSL的CTC-DID模型在有限数据集上训练后,优于微调的Whisper和ECAPA-TDNN模型。值得注意的是,CTC-DID在Casablanca数据集上的零样本评估中也优于这些模型。该提议方法对较短的语音片段更鲁棒,并且被证明易于适用于流式、实时应用,几乎没有性能下降。
引用
@article{arxiv.2601.12199,
title = {CTC-DID: CTC-Based Arabic dialect identification for streaming applications},
author = {Muhammad Umar Farooq and Oscar Saz},
journal= {arXiv preprint arXiv:2601.12199},
year = {2026}
}
备注
Accepted for IEEE ICASSP 2026