中文

FD-Bench:面向全双工口语对话系统的全双工基准测试流水线

音频与语音处理 2025-07-28 v1 计算与语言

摘要

全双工口语对话系统(FDSDS)通过允许用户实时打断和反馈,相较于依赖轮流发言的传统SDS,实现了更自然的人机交互。然而,现有基准测试缺乏针对全双工场景的指标,例如评估模型在用户打断期间的性能。在本文中,我们提出了一种利用LLM、TTS和ASR的全面全双工基准测试流水线,以填补这一空白。该流水线通过多种新颖指标,评估FDSDS处理用户打断、管理延迟以及在挑战性场景中保持鲁棒性的能力。我们使用超过40小时的生成语音(包含293次模拟对话和1200次打断)对我们的基准测试应用于三个开源FDSDS(Moshi、Freeze-omni和VITA-1.5)。结果表明,所有模型在频繁中断和噪声条件下仍面临挑战,例如无法响应用户打断。演示、数据和代码将公开发布。

关键词

引用

@article{arxiv.2507.19040,
  title  = {FD-Bench: A Full-Duplex Benchmarking Pipeline Designed for Full Duplex Spoken Dialogue Systems},
  author = {Yizhou Peng and Yi-Wen Chao and Dianwen Ng and Yukun Ma and Chongjia Ni and Bin Ma and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2507.19040},
  year   = {2025}
}

备注

Accepted to Interspeech 2025. 5 pages