WhisperAlign:面向长篇班巴语语音的词边界感知 ASR 与 WhisperX 锚定的 Pyannote 说话人分割
声音
2026-03-06 v1 机器学习
摘要
本文提出了我们对DL Sprint 4.0的解决方案,聚焦班巴语长篇语音识别(任务1)与说话人分割(任务2)。处理长篇、多说话人班巴语音频带来显著挑战,包括语音活动检测、重叠语音及上下文保留等问题。为解决长篇转录难题,我们采用基于 whisper-timestamped 的稳健音频切块策略,将精确、上下文感知的片段输入到微调的声学模型中实现高精度转录。针对分割任务,我们构建了集成管道,集成 pyannote.audio 与 WhisperX。我们方法的一个关键贡献是针对比赛数据集对 Pyannote 分割模型进行了领域特定的微调。这一改造使模型能更好捕捉班巴语对话动态,准确解析复杂的重叠说话人边界。我们的方法论证表明,针对 ASR 实施智能时间戳切块、针对说话人分割进行精准化分割微调,能在低资源场景中显著降低词错误率(WER)和说话人分割错误率(DER)。
引用
@article{arxiv.2603.04809,
title = {WhisperAlign: Word-Boundary-Aware ASR and WhisperX-Anchored Pyannote Diarization for Long-Form Bengali Speech},
author = {Aurchi Chowdhury and Rubaiyat -E-Zaman and Sk. Ashrafuzzaman Nafees},
journal= {arXiv preprint arXiv:2603.04809},
year = {2026}
}