中文

EMOVA:赋予语言模型般情感感知、生成图像、文本与语音的能力

计算机视觉与模式识别 2025-03-21 v4 计算与语言

摘要

GPT-4o 是一个实现多情绪和语调对话的全模态模型,标志着全模态基础模型的一个里程碑。然而,赋予大型语言模型能够使用公开数据 end-to-end 感知和生成图像、文本和语音仍具有挑战性。现有的视觉语言模型依赖于外部工具处理语音,而语音语言模型仍然在视觉理解能力上受限或完全没有。为解决这一差距,我们提出了 EMOVA(EMotionally Omni-present Voice Assistant),以在保持领先的视觉语言性能的同时,为大型语言模型提供 end-to-end 语音能力。我们意外发现,采用语义-声学解耦的语音标记化器后,全模态对齐进一步提升了视觉语言和语音能力,而与双模态对齐的模型表现相当。此外,我们引入了一个轻量级风格模块,用于灵活的语音风格控制,包括情绪和音调。首次,EMOVA 在视觉语言和语音基准测试上实现了最先进的性能,同时支持带有丰富情感的全模态语音对话。

关键词

引用

@article{arxiv.2409.18042,
  title  = {EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions},
  author = {Kai Chen and Yunhao Gou and Runhui Huang and Zhili Liu and Daxin Tan and Jing Xu and Chunwei Wang and Yi Zhu and Yihan Zeng and Kuo Yang and Dingdong Wang and Kun Xiang and Haoyuan Li and Haoli Bai and Jianhua Han and Xiaohui Li and Weike Jin and Nian Xie and Yu Zhang and James T. Kwok and Hengshuang Zhao and Xiaodan Liang and Dit-Yan Yeung and Xiao Chen and Zhenguo Li and Wei Zhang and Qun Liu and Jun Yao and Lanqing Hong and Lu Hou and Hang Xu},
  journal= {arXiv preprint arXiv:2409.18042},
  year   = {2025}
}

备注

Accepted by CVPR 2025. Project Page: https://emova-ollm.github.io/