Sommelier: 用于全双工语音语言模型的可扩展开放多轮音频预处理流水线
声音
2026-03-31 v2 人工智能
音频与语音处理
摘要
随着AI范式从基于文本的大语言模型(LLM)转向语音语言模型(SLM),对能够实现实时、自然人机交互的全双工系统的需求日益增长。然而,此类模型的开发受到高质量、多说话者对话数据匮乏的制约,因为现有的大规模资源主要是单说话者或规模有限。应对自然对话的复杂动态,如重叠说话和回补通道,仍是一个挑战,标准处理流水线面临说话人日记化错误和自动语音识别(ASR)幻觉问题。为弥合这一差距,我们提出了一种面向全双工模型的鲁棒且可扩展的开源数据处理流水线。
引用
@article{arxiv.2603.25750,
title = {Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models},
author = {Kyudan Jung and Jihwan Kim and Soyoon Kim and Jeonghoon Kim and Jaegul Choo and Cheonbok Park},
journal= {arXiv preprint arXiv:2603.25750},
year = {2026}
}
备注
34 pages, 7 figures, 11 tables