中文

OmniFlatten: 用于无缝语音对话的端到端GPT模型

计算与语言 2025-01-06 v2 人工智能 声音 音频与语音处理

摘要

全双工口语对话系统显著超越了传统的轮换式对话系统,因为它们允许同时进行双向通信,紧密模仿了人与人之间的交互。然而,在全双工对话系统中实现低延迟和自然交互仍然是一个重大挑战,特别是考虑到人类对话的动态性,如打断、反馈和重叠语音。在本文中,我们介绍了一种新颖的基于端到端GPT的模型OmniFlatten,用于全双工对话,能够以低延迟有效建模自然对话中固有的复杂行为。为了实现全双工对话能力,我们提出了一种多阶段后训练方案,该方案逐步将文本大语言模型(LLM)骨干适配为语音-文本对话LLM,能够实时生成文本和语音,而无需修改骨干LLM的架构。训练过程包括三个阶段:模态对齐、半双工对话学习和全双工对话学习。在所有训练阶段,我们使用扁平化操作对数据进行标准化,这使得我们能够统一不同模态和任务的训练方法和GPT骨干。我们的方法提供了一种简单的建模技术,并为开发高效、自然的端到端全双工口语对话系统提供了一个有前景的研究方向。OmniFlatten生成的对话音频样本可在本网站(https://omniflatten.github.io/)找到。

关键词

引用

@article{arxiv.2410.17799,
  title  = {OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation},
  author = {Qinglin Zhang and Luyao Cheng and Chong Deng and Qian Chen and Wen Wang and Siqi Zheng and Jiaqing Liu and Hai Yu and Chaohong Tan and Zhihao Du and Shiliang Zhang},
  journal= {arXiv preprint arXiv:2410.17799},
  year   = {2025}
}

备注

Work in progress