中文

$\tau$-Voice:在真实场景下评估全双工语音代理

声音 2026-03-17 v1 人工智能

摘要

全双工语音代理——能够同时监听和发言的系统——正快速从研究走向实际应用。然而,现有的评估在孤立的情况下分别处理对话动态和任务完成情况。我们引入 τ\tau-voice,用于评估在具有真实复杂度的任务上的语音代理。代理必须导航复杂的多轮对话,遵守领域政策,并与环境交互。该框架将 τ2\tau^2-bench 扩展为一种新的语音代理基准,结合了可验证的复杂任务完成情况、全双工交互和真实音频,实现语音与文本性能的直接比较。提供可控且真实的语音用户模拟器,包括多样化的口音、真实的音频环境以及丰富的轮次动态;通过将模拟与墙钟时间解耦,用户模拟器可在不受实时约束的情况下使用最强大的 LLM。我们评估了任务完成情况 (pass@1) 和语音交互质量,涵盖 278 个任务:虽然 GPT-5(推理)达到 85%,但语音代理仅在干净条件下达到 31--51%,在具有噪声和多样化口音的真实条件下仅达到 26--38%——仅保留了 30--45% 的文本能力;定性分析确认 79--90% 的失败源于代理行为,表明我们评估设置下的大部分失败主要反映代理行为。τ\tau-voice 为衡量向自然、对话式和可靠的语音代理迈进提供了可复现的测试平台。

关键词

引用

@article{arxiv.2603.13686,
  title  = {$\tau$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains},
  author = {Soham Ray and Keshav Dhandhania and Victor Barres and Karthik Narasimhan},
  journal= {arXiv preprint arXiv:2603.13686},
  year   = {2026}
}