中文

赋予聊天机器人眼睛和耳朵:面向动态交互的沉浸式多模态对话系统

计算与语言 2025-06-03 v1 人工智能 计算机视觉与模式识别

摘要

随着聊天机器人不断向拟人化、真实世界交互演进,多模态仍是一个活跃的研究与探索领域。迄今为止,将多模态融入聊天机器人的努力主要集中在以图像为中心的任务上,如视觉对话和基于图像的指令,强调人类感知中的“眼睛”而忽视了“耳朵”,即听觉方面。此外,这些研究通常围绕静态交互展开,侧重于讨论模态本身而非将其自然融入对话中,这限制了同时性动态交互的丰富性。此外,尽管多模态已在多方多轮对话中进行了探索,但特定任务的约束阻碍了其无缝集成到动态、自然的对话中。为了应对这些挑战,本研究旨在为聊天机器人配备“眼睛和耳朵”,使其能够与人类进行更具沉浸感的交互。作为这项工作的一部分,我们引入了一个新的多模态对话数据集——多模态多轮多方对话(M3CM^3C),并提出了一种具有多模态记忆检索功能的新型多模态对话模型。我们的模型在 M3CM^3C 上进行训练,展示了在类似真实世界的复杂环境中与多名说话者无缝进行长期对话的能力,能够有效处理视觉和听觉输入以理解并做出恰当回应。人工评估突显了该模型在保持连贯和动态交互方面的出色表现,展示了其作为高级多模态对话代理的潜力。

关键词

引用

@article{arxiv.2506.00421,
  title  = {Enabling Chatbots with Eyes and Ears: An Immersive Multimodal Conversation System for Dynamic Interactions},
  author = {Jihyoung Jang and Minwook Bae and Minji Kim and Dilek Hakkani-Tur and Hyounghun Kim},
  journal= {arXiv preprint arXiv:2506.00421},
  year   = {2025}
}

备注

ACL 2025 (32 pages); Project website: https://m3c-dataset.github.io/