MTalk-Bench:通过 Arena 式和评分标准协议评估多轮对话中的语音到语音模型
计算与语言
2025-09-16 v2 人工智能
摘要
语音到语音(S2S)大型语言模型(LLM)的快速发展显著提升了实时语音交互的效果。然而,当前的评估框架在评估复杂多轮对话方面仍不充分。为此,我们引入 MTalk-Bench,一个覆盖三个核心维度的多轮 S2S 基准:语义信息、语音语用信息和环境声音。每个维度包括九个真实情景,以及用于评估特定能力(如推理)的针对性任务。我们的双方法评估框架结合了 Arena 式评估(成对比较)和基于评分标准的评估(绝对评分),用于相对和绝对评估。基准包括模型和人类输出,由人类评估者和 LLM 进行评估。实验结果揭示了两组发现:S2S LLM 的整体性能(1)在语义信息处理方面表现出色,但在语音语用信息和环境声音感知方面表现不足;(2)模型通常通过增加响应长度来恢复连贯性,在多轮对话中牺牲了效率;(3)具备模态感知、任务特定设计的模型优于粗暴扩张。评估框架与可靠性(1)Arena 与评分标准的结果一致,互为补充,但只有在性能差距较大时才能可靠地区分;(2)LLM 作为评判者在差距明显或标准明确时与人类一致,但存在位置和长度偏差,且仅在文本标注下才能可靠地评估非语言信息。这些结果凸显了当前 S2S 评估的局限性,以及需要更健全、语言感知的评估框架。
引用
@article{arxiv.2508.18240,
title = {MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols},
author = {Yuhao Du and Qianwei Huang and Guo Zhu and Zhanchen Dai and Shunian Chen and Qiming Zhu and Le Pan and Minghao Chen and Yuhao Zhang and Li Zhou and Benyou Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2508.18240},
year = {2025}
}