中文

面向说话风格的音频感知大语言模型判官

音频与语音处理 2025-06-09 v1 人工智能 计算与语言

摘要

音频感知大语言模型(ALLM)能够理解音频输入中的文本与非文本信息。在本文中,我们探索使用ALLM作为自动判官来评估语音风格。我们使用ALLM判官评估由四个口述语言模型(SLMs)在两个任务中生成的语音:语音风格指令遵循和角色扮演。我们考虑的说话风格包括情感、音量、说话节奏、词语强调、音调控制以及非语言元素。我们使用四个口述语言模型(SLMs)完成这两个任务,并使用人类和ALLM来评估SLMs的响应。我们将两种ALLM判官,GPT-4o-audio和Gemini-2.5-pro,与人类评估结果进行比较,结果显示Gemini与人类评估者的一致性相当于人类评估者之间的一致性。这些鼓舞人心的结果表明,ALLM可用于评估SLMs。我们的研究结果还揭示了即便是GPT-4o-audio,也在控制说话风格和生成自然对话方面仍有提升空间。

关键词

引用

@article{arxiv.2506.05984,
  title  = {Audio-Aware Large Language Models as Judges for Speaking Styles},
  author = {Cheng-Han Chiang and Xiaofei Wang and Chung-Ching Lin and Kevin Lin and Linjie Li and Radu Kopetz and Yao Qian and Zhendong Wang and Zhengyuan Yang and Hung-yi Lee and Lijuan Wang},
  journal= {arXiv preprint arXiv:2506.05984},
  year   = {2025}
}