谈话轮次:基于转移动态对话音频基础模型的基准测试
计算与语言
2025-03-04 v1 声音
音频与语音处理
摘要
近期涌现的音频基础模型 (FMs) 可能为对话建模提供新能力。然而,针对这些音频 FMs 在自然交互式对话能力的全面评估 efforts 仍有限。为了与最终用户进行有意义的对话,我们希望 FMs 能够在不产生过多重叠语音或长时间沉默的情况下,完成流畅的轮次转换。鼓励此思路,我们提出了一个新型评估方案,用于评估语音对话系统的轮次转换能力。该方案使用监督模型作为评判器,该模型已训练用于预测人类-人类对话中的轮次转换事件。使用该方案,我们进行了首次全面的用户研究,评估了现有语音对话系统在轮次转换事件方面的能力,并揭示了许多有趣的见解,例如它们有时不理解何时该说话、过于激进地干扰他人且很少进行背通。我们进一步评估了通过 API 可访问的多个开源和专有音频 FMs 在从 Switchboard 精心挑选的测试基准上的理解和预测轮次转换事件的能力,并确定在这方面存在显著的提升空间。我们将开源我们的评估平台,以推动开发更先进的对话 AI 系统。
关键词
引用
@article{arxiv.2503.01174,
title = {Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics},
author = {Siddhant Arora and Zhiyun Lu and Chung-Cheng Chiu and Ruoming Pang and Shinji Watanabe},
journal= {arXiv preprint arXiv:2503.01174},
year = {2025}
}
备注
Accepted at ICLR 2025