中文

从文本到语音:评估工具调用LLM代理的可重复性与可验证性框架

计算与语言 2026-05-21 v2

摘要

语音代理日益需要可靠的语音工具使用,而突出的工具调用基准仍基于文本。我们研究在不重新标注工具模式和金标准标签的前提下,将经验证的文本基准转换为受控音频基于工具调用评估是否可行。我们的数据集无关框架使用文本转语音、说话者变异和环境噪声创建配对文本-音频实例,同时保留原始数据集注释。基于对7个全模态模型在音频转换版Confetti和When2Call上的广泛评估,我们的框架表明性能对模型和任务而言具有很强的依赖性:Gemini-3.1-Flash-Live在Confetti上取得最高得分(70.4),而GPT-Realtime-1.5在When2Call上表现最佳(71.9)。在Confetti上,文本到语音的差距范围为Qwen3-Omni的1.8分到GPT-Realtime-1.5的4.8分。针对失败案例的针对性分析表明,性能下降最常反映的是对语音中论点值的误解。考虑到实际部署场景,我们进一步报告了文本-only结果、基于歧义的改写压力测试,以及经人类偏好验证的参考-free LLM-as-judge协议。值得注意的是,我们发现至少具有8B参数的开源Qwen3评判器在与专有评判器之间超过80%的一致性,支持面向隐私的评估。总体而言,我们的框架提供了一个可验证、可重复的第一阶段诊断,补充目的音频语料库。

关键词

引用

@article{arxiv.2605.15104,
  title  = {From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents},
  author = {Md Tahmid Rahman Laskar and Xue-Yong Fu and Seyyed Saeed Sarfjoo and Quinten McNamara and Jonas Robertson and Shashi Bhushan TN},
  journal= {arXiv preprint arXiv:2605.15104},
  year   = {2026}
}