中文

孟加拉-环: 用于长文本孟加拉语语音识别和说话人分割的社区基准

声音 2026-02-17 v1 音频与语音处理

摘要

尽管孟加拉语在长篇语音技术中应用广泛,但仍处于资源匮乏的局面。我们提出孟加拉-环 (Bengali-Loop),两个社区基准用于解决这一问题:(1) 来自 11 个 YouTube 频道的 191 段录音(158.6 小时,79.2 万字)的长文本语音识别语料库,通过可重复的字幕提取管道和人工验证转录获得;(2) 包含 24 段录音(22 小时,5744 段已标记说话人段)的说话人分割语料库,包含完全人工标记的说话人转换标签(CSV 格式)。两个基准针对现实中的多说话人、长时长内容(例如孟加拉戏曲/自然对话)设计。我们建立基线(Tugstugi: 34.07% WER;pyannote.audio: 40.08% DER),并提供标准化的评估协议(WER/CER、DER)、标注规则和数据格式,以支持可重复的基准测试和孟加拉语长文本语音识别和分割的后续模型开发。

关键词

引用

@article{arxiv.2602.14291,
  title  = {Bengali-Loop: Community Benchmarks for Long-Form Bangla ASR and Speaker Diarization},
  author = {H. M. Shadman Tabib and Istiak Ahmmed Rifti and Abdullah Muhammed Amimul Ehsan and Somik Dasgupta and Md Zim Mim Siddiqee Sowdha and Abrar Jahin Sarker and Md. Rafiul Islam Nijamy and Tanvir Hossain and Mst. Metaly Khatun and Munzer Mahmood and Rakesh Debnath and Gourab Biswas and Asif Karim and Wahid Al Azad Navid and Masnoon Muztahid and Fuad Ahmed Udoy and Shahad Shahriar Rahman and Md. Tashdiqur Rahman Shifat and Most. Sonia Khatun and Mushfiqur Rahman and Md. Miraj Hasan and Anik Saha and Mohammad Ninad Mahmud Nobo and Soumik Bhattacharjee and Tusher Bhomik and Ahmmad Nur Swapnil and Shahriar Kabir},
  journal= {arXiv preprint arXiv:2602.14291},
  year   = {2026}
}