谁说了什么?评估面向对话式语音识别的 spoken language models
计算与语言
2026-03-25 v1 音频与语音处理
摘要
对话式自动语音识别因重叠语音、远场噪声和说话人数的变化而具有挑战性。虽然最近的 LLM-based 系统在单说话人基准测试中表现良好,但在多说话人场景下的鲁棒性尚不明确。我们系统地沿用四个维度比较 LLM-based 和模块化管道方法:重叠鲁棒性、语义保真度、说话人数以及单通道与多通道输入。为捕捉常规指标遗漏的语义变更错误,我们引入 tcpSemER,将其扩展为替换 Levenshtein 距离为基于嵌入的语义相似度。我们进一步将 tcpWER 分解为重叠和非重叠组件,以获得更细致的分析。跨三个数据集的实验表明,LLM-based 系统在双说话人场景中表现有竞争力,但随着说话人数和重叠度的增加而恶化,而模块化管道保持更好的鲁棒性。
引用
@article{arxiv.2603.22709,
title = {Who Spoke What When? Evaluating Spoken Language Models for Conversational ASR with Semantic and Overlap-Aware Metrics},
author = {Naohiro Tawara and Samuele Cornell and Alexander Polok and Marc Delcroix and Lukáš Burget and Shinji Watanabe},
journal= {arXiv preprint arXiv:2603.22709},
year = {2026}
}
备注
Submitted to INTERSPEECH 2026