FLEXI: 全双工人机 LLM 语音交互基准测试
计算与语言
2025-09-29 v1
摘要
全双工语音到语音大语言模型(LLM)是自然人机交互的基础,使实时口语对话系统成为可能。然而,对这些模型进行基准测试和建模仍然是一个基本挑战。我们引入了 FLEXI,第一个全双工 LLM-人类口语交互基准,明确纳入了紧急场景中的模型中断。FLEXI 通过六种多样化的人机 LLM 交互场景系统地评估实时对话的延迟、质量和对话有效性,揭示了开源模型与商业模型在紧急意识、终止对话和交互延迟方面的显著差距。最后,我们建议下一个词对预测为实现真正无缝且类人的全双工交互提供了一条有前景的路径。
引用
@article{arxiv.2509.22243,
title = {FLEXI: Benchmarking Full-duplex Human-LLM Speech Interaction},
author = {Yuan Ge and Saihan Chen and Jingqi Xiao and Xiaoqian Liu and Tong Xiao and Yan Xiang and Zhengtao Yu and Jingbo Zhu},
journal= {arXiv preprint arXiv:2509.22243},
year = {2025}
}