用于 MLC-SLM 挑战的 BUT 系统
音频与语音处理
2025-06-17 v1
摘要
我们提出了一个结合DiCoW(基于Whisper的流动-条件变体)与DiariZen(基于Pyannote构建的流动管线)的双说话人自动语音识别 (ASR) 系统。首先在无需微调的域外 (OOD) 多语言场景中评估这两个系统。在此场景下,DiariZen consistently优于基线Pyannote流动模型,表现出强大的泛化能力。尽管DiCoW是针对目标说话人ASR微调的英语数据,但仍保持出色的多语言性能,表明编码器修改保留了Whisper的多语言能力。随后我们在MLC-SLM挑战数据上对DiCoW和DiariZen进行微调。微调后的DiariZen继续优于微调后的Pyannote基线,而DiCoW从域适应中获得进一步提升。我们的最终系统在MLC-SLM挑战任务2中实现了微平均tcpWER/CER为16.75%,排名第二。最后,我们识别出训练数据中存在若干标注不一致问题——如缺失语音段和错误的静默标注——这会阻碍流动微调。我们提出了简单的缓解策略以提高系统鲁棒性。
引用
@article{arxiv.2506.13414,
title = {BUT System for the MLC-SLM Challenge},
author = {Alexander Polok and Jiangyu Han and Dominik Klement and Samuele Cornell and Jan Černocký and Lukáš Burget},
journal= {arXiv preprint arXiv:2506.13414},
year = {2025}
}