巴尔加语长篇语音处理:自动语音识别与说话人分割
计算与语言
2026-02-26 v1 机器学习
声音
摘要
我们描述了用于巴尔加语长篇语音识别(ASR)和说话人分割的端到端系统,该系统提交至Kaggle上的DL Sprint 4.0竞赛。巴尔加语对两项任务都提出了重大挑战:大音素库、显著的方言差异、频繁的英语代码混合,以及相对稀缺的大规模标注语料。对于ASR,我们实现的最佳私有词错误率(WER)为0.37738,公开WER为0.36137,采用BengaliAI微调的Whisper medium模型搭配Demucs语音分离、静音边界分块和精心调优的生成超参数。对于说话人分割,我们实现的最佳私有Diarization Error Rate(DER)为0.27671,公开DER为0.20936,通过替换pyannote.audio流水线中的默认分割模型为巴尔加语微调版本,配合wespeaker-voxceleb-resnet34-LM嵌入和基于质心的聚类方法。我们的实验表明,针对低资源巴尔加语语音处理,域特定的分割组件微调、语音来源分离以及自然的静音感知分块是三个最具影响力的设计选择。
引用
@article{arxiv.2602.21741,
title = {Robust Long-Form Bangla Speech Processing: Automatic Speech Recognition and Speaker Diarization},
author = {MD. Sagor Chowdhury and Adiba Fairooz Chowdhury},
journal= {arXiv preprint arXiv:2602.21741},
year = {2026}
}
备注
6 pages, 5 figures, 3 tables; system paper submitted to DL Sprint 4.0 (Kaggle)