ShobdoSetu:孟加拉长篇语音识别与说话人分割的数据主导框架
计算与语言
2026-03-23 v1
摘要
孟加拉语拥有超过 2.3 亿使用者,然而在自动语音识别(ASR)和说话人分割研究中仍严重缺乏服务。本文介绍了我们为 DL Sprint 4.0 孟加拉长篇语音识别(Task 1)和孟加拉说话人分割挑战赛(Task 2)所构建的系统。对于 Task 1,我们提出了数据主导的管道,从孟加拉 YouTube 读书视频和戏剧节目中构建高质量训练语料库,采用 LLM 辅助语言规范化、模糊匹配式块边界验证和模糊区增强。使用 beam size 为 5 在约 21,000 个数据点上微调 tugstugi/whisper-medium 模型,在公开排行榜上实现 16.751% 的词错误率(WER),在私有测试集上实现 15.551% 的 WER。对于 Task 2,我们在极端低资源条件下(仅 10 个训练文件)微调 pyannote.audio 社区版 1 分割模型,并进行针对性超参数优化,在公开排行榜上实现 0.19974 的说话人分割错误率(DER),在私有测试集上实现 0.26723 的 DER。我们的结果表明,严谨的数据工程和领域适应性微调即使没有大规模标注语料库,也能为孟加拉语语音处理带来竞争性能。
引用
@article{arxiv.2603.19256,
title = {ShobdoSetu: A Data-Centric Framework for Bengali Long-Form Speech Recognition and Speaker Diarization},
author = {Md. Nazmus Sakib and Shafiul Tanvir and Mesbah Uddin Ahamed and H. M. Aktaruzzaman Mukdho},
journal= {arXiv preprint arXiv:2603.19256},
year = {2026}
}
备注
7 pages, 4 figures