中文

VoiceAgentBench:语音助手是否准备好执行智能体任务?

人工智能 2026-02-16 v3 计算与语言 机器学习

摘要

大规模语音语言模型已使语音助手能够理解自然语言查询并执行复杂任务。然而,现有语音基准主要聚焦于独立能力,如语音转文本或问答,不系统评估智能体行为或对抗鲁棒性。为此,我们引入 VoiceAgentBench,这是一个用于评估 SpeechLMs 在真实语音智能体设置下的综合基准,包含 6000 多条合成语音查询,涵盖单工具调用、多工具工作流程、多轮对话和安全评估,覆盖英文及六种印度语言。为确保说话人多样性,我们进一步采用新颖的抽样策略,基于说话人嵌入选择 TTS 语音转换音频,以最大化声学多样性。我们的评估测量工具选择准确率、结构一致性以及工具调用的正确性,包括对抗鲁棒性。在智能体任务中,ASR-LLM 流水线优于端到端 SpeechLMs,在英文上实现最高可达 60.6% 的平均参数填充准确率,而 SpeechLMs 在印度语言上的表现较差且退化更尖锐。所有模型在顺序工作流程和安全评估方面都表现不佳,凸显了工具编排、多语言泛化和安全鲁棒性方面的持久局限。VoiceAgentBench 已在 Hugging Face 上公开,代码仓库地址为 https://github.com/ola-krutrim/VoiceAgentBench。

关键词

引用

@article{arxiv.2510.07978,
  title  = {VoiceAgentBench: Are Voice Assistants ready for agentic tasks?},
  author = {Dhruv Jain and Harshit Shukla and Gautam Rajeev and Ashish Kulkarni and Chandra Khatri and Shubham Agarwal},
  journal= {arXiv preprint arXiv:2510.07978},
  year   = {2026}
}