中文

E3RG:基于多模态大语言模型的显式情感驱动的共情响应生成系统

人工智能 2025-08-19 v1 计算与语言 计算机视觉与模式识别 人机交互 多媒体

摘要

多模态共情响应生成 (MERG) 对构建具备情感智能的人机交互至关重要。尽管大型语言模型 (LLM) 已显著提升了基于文本的共情响应生成,但在处理多模态情感内容和保持身份一致性方面仍面临挑战。因此,我们提出了 E3RG,一个基于多模态大语言模型的显式情感驱动的共情响应生成系统,该系统将 MERG 任务分解为三个部分:多模态共情理解、共情记忆检索和多模态响应生成。通过集成先进的表达性语音和视频生成模型,E3RG 能够在无需额外训练的情况下提供自然、情感丰富且身份一致的响应。实验验证了该系统在零样本和少样本设置下的优势,在 ACM MM 25 的基于 Avatar 的多模态共情挑战中取得了第一名。我们的代码已公开于 https://github.com/RH-Lin/E3RG。

关键词

引用

@article{arxiv.2508.12854,
  title  = {E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model},
  author = {Ronghao Lin and Shuai Shen and Weipeng Hu and Qiaolin He and Aolin Xiong and Li Huang and Haifeng Hu and Yap-peng Tan},
  journal= {arXiv preprint arXiv:2508.12854},
  year   = {2025}
}

备注

Accepted at ACM MM 2025 Grand Challenge