通过极端数据增强与完美对齐:长篇孟加拉语自动语音识别与说话人分割
声音
2026-02-27 v1 人工智能
计算与语言
音频与语音处理
摘要
尽管孟加拉语自动语音识别(ASR)取得了显著进展,但处理长时长音频和进行稳健的说话人分割仍是关键研究空白。为解决该语言缺乏联合ASR和说话人分割资源的严重问题,本文引入了Lipi-Ghor-882,一个包含882小时多说话人孟加拉语数据集。本文详细阐述了我们提交至DL Sprint 4.0比赛的方案,系统评估了各种用于长篇孟加拉语语音的架构和方法。对于ASR,我们证明,原始数据扩展无效;相反,利用完美对齐的注释配合合成声学退化(噪声和混响)进行的针对性微调是最有效的方法。相反,对于说话人分割,我们发现,全球开源最先进模型(如Diarizen)在该复杂数据集上表现出意外地差。大量模型重新训练仅带来微小的改进;相反,对基线模型输出进行战略性、启发式的后处理是提高准确率的主要驱动力。最终,这项工作概述了一条高优化的双管线实现,达到约0.019的实时因子(RTF),为低资源、长时长语音处理 establish a practical, empirically backed benchmark.
引用
@article{arxiv.2602.23070,
title = {Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment},
author = {Sanjid Hasan and Risalat Labib and A H M Fuad and Bayazid Hasan},
journal= {arXiv preprint arXiv:2602.23070},
year = {2026}
}
备注
4 pages, 2 figures