巴尔坎语长篇语音转录与说话人分割方法的探究
声音
2026-03-04 v1 人工智能
摘要
巴尔坎语在语音技术领域仍属于低资源语言,尤其是对于复杂任务如长篇转录和说话人分割。本文提出了用于 "DL Sprint 4.0 - Bengali Long-Form Speech Recognition" 和 "DL Sprint 4.0 - Bengali Speaker Diarization" 比赛的多阶段方法,以解决小时级别录音中 "谁何时说了什么" 的挑战。我们实现了在巴尔坎语数据上微调的 Whisper Medium(bengaliAI/tugstugi bengaliai-asr whisper-medium)进行转录,并将 pyannote/speaker-diarization-community-1 与自定义训练的分割模型集成,以处理多样且噪声环境。通过两遍方法进行超参数调优,我们在私有榜单上获得了 DER 为 0.27,在公共榜单上为 0.19。对于转录,分块、背景噪声清理和算法后处理使其在私有榜单上达到 WER 为 0.38。这些结果表明,针对性调优和战略数据利用可显著提升面向南亚语言的 AI 包容性。所有相关代码均 available at: https://github.com/Short-Potatoes/Bengali-long-form-transcription-and-diarization.git
引用
@article{arxiv.2603.03158,
title = {An Investigation Into Various Approaches For Bengali Long-Form Speech Transcription and Bengali Speaker Diarization},
author = {Epshita Jahan and Khandoker Md Tanjinul Islam and Pritom Biswas and Tafsir Al Nafin},
journal= {arXiv preprint arXiv:2603.03158},
year = {2026}
}
备注
5 pages, 2 figures