中文

面向长篇 Bangla 语音识别与说话人分割的优化 VAD 与 CTC 对齐的整体框架

声音 2026-02-27 v1 人工智能

摘要

尽管班达语是全球最广泛使用语言之一,但在自然语言处理(NLP)领域仍属低资源语言。主流的班达语自动语音识别(ASR)和说话人分割系统在处理超过 3060 秒的长时段音频时表现不佳。本文提出一种针对长时段班达语内容的稳健框架,利用预训练模型并引入新优化管道,以适应 DL Sprint 4.0 竞赛需求。我们的方法采用语音活动检测(VAD)优化技术,并通过强制词对齐实现连接时序分类(CTC)分段,维持长时段音频的时序准确性与转录完整性。此外,我们采用多项微调技术,对数据进行数据增强和降噪预处理。通过在复杂多说话人环境中弥合性能差距,本工作为实际场景下的长篇班达语语音应用提供可扩展解决方案。

关键词

引用

@article{arxiv.2602.22935,
  title  = {A Holistic Framework for Robust Bangla ASR and Speaker Diarization with Optimized VAD and CTC Alignment},
  author = {Zarif Ishmam and Zarif Mahir and Shafnan Wasif and Md. Ishtiak Moin},
  journal= {arXiv preprint arXiv:2602.22935},
  year   = {2026}
}

备注

5 pages