StyleBench:评估对话式说话风格控制能力的语音语言模型基准
计算与语言
2026-03-10 v1
摘要
语音语言模型(Speech Language Models, SLMs)通过融合语音的非语言信息,显著扩展了基于文本的大型语言模型(LLMs)的交互能力。为实现更具定制化风格的逼真交互体验,当前的 SLMs 已能够在对话过程中解释并控制来自用户提示的说话风格强度。然而,仍缺乏系统性的基准测试来量化和评估对话中说话风格强度控制能力。本文提出 StyleBench,一个多轮对话基准,用于全面评估说话风格强度控制能力,涵盖四个维度:情绪、语速、音量和音调。我们的结果揭示了领先 SLMs 与全能语言模型(Omni Language Models, OLMs)之间的性能差距,从而揭示了潜在原因并为未来探索指出了有前景的路径。
引用
@article{arxiv.2603.07599,
title = {StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control},
author = {Haishu Zhao and Aokai Hao and Yuan Ge and Zhenqiang Hong and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2603.07599},
year = {2026}
}