SpeakerSleuth:大型音频语言模型能否判断多轮对话中的说话人一致性?
计算与语言
2026-04-21 v2
摘要
大型音频语言模型(LALMs)作为评判器已成为评估语音生成质量的热门方法,但其在评估跨多轮对话说话人一致性方面的能力尚未探索。我们提出了 SpeakerSleuth,一个评估 LALMs 是否能可靠判断跨多轮对话说话人一致性的基准测试。该基准包含 1,818 个经过人工验证的评估实例,覆盖四个多样化数据集,包含合成语音与真实语音,并控制声学难度。评估十二个广泛使用的 LALMs,发现这些模型在可靠检测声学不一致性方面存在困难。例如,对于相同说话人语音的多轮对话,一些模型会过度预测不一致,而另一些则过于宽容。模型进一步困难地识别具体哪些轮次存在问题。当提供其他说话人的语音作为文本上下文时,性能会显著下降,因为模型倾向于优先考虑文本连贯性而非声学线索,甚至无法检测到说话人性别的明显切换。在另一方面,模型在比较和排序声学变体方面表现更好,显示出固有的声学辨别能力。这些发现揭示了 LALMs 中的显著偏见:它们倾向于优先考虑文本而非声学信息,暴露了构建可靠音频语言评判器所需解决的根本性模态不平衡问题。我们的代码和数据已在 https://github.com/holi-lab/SpeakerSleuth 上提供。
引用
@article{arxiv.2601.04029,
title = {SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?},
author = {Jonggeun Lee and Junseong Pyo and Gyuhyeon Seo and Yohan Jo},
journal= {arXiv preprint arXiv:2601.04029},
year = {2026}
}
备注
Accepted at ACL 2026 (Main)