S2S-Arena:语音到语音模型中语义指令遵循的评估基准
计算与语言
2026-05-11 v2 声音
音频与语音处理
摘要
近期大型语言模型(LLM)的快速发展彻底改变了语音到语音(S2S)系统的面貌,使其能够实现越来越自然的语音交互。然而,现有基准仍严重依赖基于文本的评估,基本忽视了诸如韵律、情感和说话者特征等语义线索,这些线索是表达性和人类化沟通的核心。我们引入 S2S-Arena,一个面向语义指令遵循的语音原生基准,显式评估语义理解和语义表达。S2S-Arena 包含四层交互协议,系统性地探讨在日益复杂的语义线索条件下的模型表现;采用两阶段数据构建流程,生成 1243 个语音样本,覆盖 100 多个真实场景任务;并构建一种基于语音模态的竞技场式评估框架,实现对语音模态中无参考的成对比较。对 10 个最先进 S2S 系统进行 1000 多次比较评测,发现当前学术与产业系统在复杂语义线索需求下存在显著性能差距。我们的分析进一步识别了支配表达性指令遵循的关键设计因素,为构建更自然、稳健且符合人类期望的语音智能体提供了可操作的见解。
引用
@article{arxiv.2503.05085,
title = {S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models},
author = {Feng Jiang and Zhiyu Lin and Yiyang Liu and Liumeng Xue and Fan Bu and Yuhao Du and Xiangying Chen and Benyou Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2503.05085},
year = {2026}
}
备注
Accepted by ACL 2026 main