中文

OmniResponse:二元交互中的在线多模态对话响应生成

计算机视觉与模式识别 2025-10-29 v2 人工智能 人机交互

摘要

在本文中,我们引入了在线多模态对话响应生成(OMCRG),这是一项新颖的任务,旨在根据说话者的多模态输入,在线生成同步的言语和非言语听者反馈。OMCRG 捕捉自然的二元交互,并在将生成的音频与听者的面部响应对齐方面引入了新的挑战。为了应对这些挑战,我们引入文本作为中间模态来连接音频和面部响应。我们提出了 OmniResponse,这是一种多模态大语言模型(MLLM),能够自回归地生成准确的多模态听者响应。OmniResponse 利用一个预训练的 LLM,并通过两个核心组件对其进行增强:Chrono-Text Markup(为生成的文本 token 精确添加时间戳)和 TempoVoice(一个可控的在线文本转语音(TTS)模块,输出与面部响应同步的语音)。为了推动 OMCRG 研究,我们提供了 ResponseNet 数据集,包含 696 次详细的二元交互,具有同步的分屏视频、多通道音频、转录文本和标注的面部行为。在 ResponseNet 上的综合评估表明,OmniResponse 在语义语音内容、视听同步和生成质量方面均优于基线模型。我们的数据集、代码和模型已公开发布。

关键词

引用

@article{arxiv.2505.21724,
  title  = {OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions},
  author = {Cheng Luo and Jianghui Wang and Bing Li and Siyang Song and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2505.21724},
  year   = {2025}
}

备注

25 pages, 9 figures