OmniChat:通过可扩展合成数据提升口语对话系统以适应多样场景
计算与语言
2025-01-03 v1 人机交互
声音
音频与语音处理
摘要
随着大型语言模型的快速发展,研究人员创建了日益先进的口语对话系统,能够自然地与人类对话。然而,这些系统仍然难以处理现实对话的全部复杂性,包括音频事件、音乐背景以及情感表达,主要因为当前对话数据集在规模和场景多样性方面受到限制。本文提出利用合成数据来增强跨不同场景的对话模型。我们引入 ShareChatX,这是第一个涵盖多样场景的全面大规模口语对话数据集。基于该数据集,我们提出 OmniChat,一种多轮对话系统,具备异构特征融合模块,旨在优化不同对话情境中的特征选择。此外,我们探讨了使用合成数据训练对话系统的关键方面。通过全面实验,我们确定了合成数据与真实数据的理想比例,实现了在真实世界对话数据集 DailyTalk 上的最先进结果。我们还强调了合成数据在应对多样化、复杂对话场景(特别是涉及音频和音乐的场景)中的重要作用。更多细节请访问我们的演示页面 \url{https://sharechatx.github.io/}。
引用
@article{arxiv.2501.01384,
title = {OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios},
author = {Xize Cheng and Dongjie Fu and Xiaoda Yang and Minghui Fang and Ruofan Hu and Jingyu Lu and Bai Jionghao and Zehan Wang and Shengpeng Ji and Rongjie Huang and Linjun Li and Yu Chen and Tao Jin and Zhou Zhao},
journal= {arXiv preprint arXiv:2501.01384},
year = {2025}
}