中文

面对面对话:口语对话模型

计算机视觉与模式识别 2024-08-05 v2 人工智能 人机交互

摘要

本文介绍一种新颖的面对面口语对话模型。它处理用户输入的音频-视觉语音,并生成音频-视觉语音作为响应,标志着创建无需依赖中间文本的头像聊天机器人系统的第一步。为此,我们首次引入MultiDialog——第一个大规模多模态(即音频和视觉)口语对话语料库,包含约340小时的约9000段对话,基于开放领域对话数据集TopicalChat录制。MultiDialog包含对话者根据给定脚本进行的平行音频-视觉录音,包含情感标注,我们期待为多模态合成开辟研究机会。我们的面对面口语对话模型包含文本预训练的大型语言模型,并通过整合语音-文本联合预训练将其适应音频-视觉口语对话领域。通过大量实验,我们验证了该模型在促进面对面对话方面的有效性。演示和数据分别可在https://multidialog.github.io和https://huggingface.co/datasets/IVLLab/MultiDialog获取。

关键词

引用

@article{arxiv.2406.07867,
  title  = {Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation},
  author = {Se Jin Park and Chae Won Kim and Hyeongseop Rha and Minsu Kim and Joanna Hong and Jeong Hun Yeo and Yong Man Ro},
  journal= {arXiv preprint arXiv:2406.07867},
  year   = {2024}
}

备注

Accepted to ACL 2024 (Oral)