VStyle:基于口语指令的人声风格适应基准
声音
2025-09-23 v2 人工智能
计算与语言
音频与语音处理
摘要
口语语言模型(SLMs)已成为语音理解与生成的统一范式,实现了自然的人机交互。然而尽管大多数进展聚焦于语义准确性和指令遵循,但SLMs根据口语指令调整说话风格的能力受到有限关注。我们提出Voice Style Adaptation(VSA)新任务,探讨SLMs是否能根据自然语言口语命令修改其说话风格,如音色、韵律或角色设定。为研究此任务,本文引入VStyle基准,涵盖四类语音生成:声学属性、自然语言指令、角色扮演及隐式共情。我们还提出Large Audio Language Model as a Judge(LALM as a Judge)框架,沿文本忠实性、风格遵循度与自然度三个维度逐步评估输出,确保可复现且客观的评估。实验在商业系统和开源SLMs上表明,当前模型在可控风格适应方面存在明显局限,凸显了该任务的新颖性与挑战性。通过发布VStyle及其评估工具包,我们旨在为社区提供推动以人类为中心的语音交互发展的基础。数据集与代码已公开于\href{https://junzhan2000.github.io/VStyle.github.io/}{项目主页}。
引用
@article{arxiv.2509.09716,
title = {VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions},
author = {Jun Zhan and Mingyang Han and Yuxuan Xie and Chen Wang and Dong Zhang and Kexin Huang and Haoxiang Shi and DongXiao Wang and Tengtao Song and Qinyuan Cheng and Shimin Li and Jun Song and Xipeng Qiu and Bo Zheng},
journal= {arXiv preprint arXiv:2509.09716},
year = {2025}
}