中文

VoiceAssistant-Eval:跨听、说、看评估 AI 助手

计算与语言 2025-09-29 v1 人工智能 计算机视觉与模式识别 人机交互 声音

摘要

大语言模型和多模态系统日益增强的能力激发了对语音优先 AI 助手的兴趣,但现有基准不足以评估这些系统能力的全貌。我们引入了 VoiceAssistant-Eval,一个旨在跨听、说、看评估 AI 助手的综合基准。VoiceAssistant-Eval 包含 10,497 个精选示例,涵盖 13 个任务类别。这些任务包括用于听的自然声音、音乐和口语对话;用于说的多轮对话、角色扮演模仿及各种场景;以及用于看的高度异构图像。为展示其效用,我们评估了 21 个开源模型和 GPT-4o-Audio,测量了响应内容和语音的质量及其一致性。结果揭示了三个关键发现:(1)专有模型并未在所有方面普遍优于开源模型;(2)大多数模型擅长说话任务但在音频理解上滞后;(3)设计良好的小型模型可媲美大得多的模型。值得注意的是,中等规模的 Step-Audio-2-mini (7B) 的听力准确率是 LLaMA-Omni2-32B-Bilingual 的两倍多。然而,挑战依然存在:多模态(音频加视觉)输入和角色扮演语音模仿任务对当前模型而言仍很困难,且在鲁棒性和安全对齐方面仍存在显著差距。VoiceAssistant-Eval 识别了这些差距,并为评估和指导下一代 AI 助手的发展建立了严格框架。代码和数据将发布于 https://mathllm.github.io/VoiceAssistantEval/ 。

关键词

引用

@article{arxiv.2509.22651,
  title  = {VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing},
  author = {Ke Wang and Houxing Ren and Zimu Lu and Mingjie Zhan and Hongsheng Li},
  journal= {arXiv preprint arXiv:2509.22651},
  year   = {2025}
}