Empathy Omni:通过大型语言模型实现具备同理心的语音响应生成
计算与语言
2025-09-18 v3 声音
音频与语音处理
摘要
随着语音大型语言模型(speech LLMs)的发展,用户现在可以直接通过语音与助手进行交互。然而,大多数现有模型仅将响应内容转换为语音,未能充分捕捉用户查询中丰富的情感线索,相同的句子可能因表达方式不同而传递不同的含义。因此,情感理解对于提高人机交互至关重要。大多数具备同理心的语音 LLMs 依赖海量数据集,计算成本高。一个关键挑战是构建在有限数据且无大规模训练的情况下生成具备同理心响应的模型。为此,我们提出了 Emotion Omni,一种能够理解用户语音中情感内容并生成具备同理心响应的模型。我们进一步开发了数据管道,以构建支持具备同理心语音助手的 20 万条情感对话数据集。实验表明,Emotion Omni 在无大规模预训练的情况下,仍能实现与现有模型相当的指令跟随能力,而在语音质量(UTMOS:4.41)和同理心(Emotion GPT Score:3.97)方面超越了现有模型。这些结果确认了其在语音保真度和情感表达方面的提升。演示可在 https://w311411.github.io/omni_demo/ 查看。
引用
@article{arxiv.2508.18655,
title = {Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models},
author = {Haoyu Wang and Guangyan Zhang and Jiale Chen and Jingyu Li and Yuehai Wang and Yiwen Guo},
journal= {arXiv preprint arXiv:2508.18655},
year = {2025}
}
备注
5 pages, 1 figure, submitted to ICASSP 2026