中文

EmoOmni:构建 Omni-Modal 大语言模型中的情感理解与表达

声音 2026-03-10 v2 音频与语音处理

摘要

Omni-Modal 大型语言模型(Omni-LLM)的演进已彻底改变人机交互,使其能够实现统一的音视频感知和语音响应。然而,现有的 Omni-LLM 在复杂的现实场景中常常难以实现深入的理解,导致情感响应与情境不匹配。这种问题在 Omni-LLM 的 Thinker-Talker 架构中尤为突出,因为这种架构通过隐藏状态进行隐式连接,导致情感细节丢失。本文提出 EmoOmni,一个用于多模态情感对话中精准理解与表达的统一框架。其核心是引入情感链式思维(E-CoT),该方法强制从细粒度的多模态感知到文本响应之间进行推理。此外,我们将 E-CoT 明确地视为高水平情感指令,以指导 talker 实现准确的情感表达。此外,我们构建 EmoOmniPipe 以获取真实世界的标注对话数据,并建立基准 EmoOmniEval 以便于系统性评估多模态情感对话任务。实验表明,在相同 talker 条件下,EmoOmni-7B 的性能与 Qwen3Omni-30B-A3B-Thinking 相当。

关键词

引用

@article{arxiv.2602.21900,
  title  = {EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs},
  author = {Wenjie Tian and Zhixian Zhao and Jingbin Hu and Huakang Chen and Haohe Liu and Binshen Mu and Lei Xie},
  journal= {arXiv preprint arXiv:2602.21900},
  year   = {2026}
}