中文

链-讲者:面向共情对话语音合成的链理解与渲染

声音 2025-05-20 v1 音频与语音处理

摘要

对话式语音合成(CSS)旨在使合成语音与用户-代理人交互的情感和风格语境一致,以实现共情。当前的生成式CSS模型因情感感知不足和冗余的离散语音编码而受到可解释性限制。为此,我们提出Chain-Talker,一个模仿人类认知的三阶段框架:情感理解从对话历史中派生情境感知情感描述;语义理解通过序列化预测生成紧凑语义代码;共情渲染通过整合两个组件合成表达性语音。为支持情感建模,我们开发了CSS-EmCap,一个由LLM驱动的自动化管道,用于生成精确的对话式语音情感标题。在三个基准数据集上的实验表明,Chain-Talker比现有方法产生更具表达性和共情性的语音,CSS-EmCap为可靠的情感建模作出了贡献。代码和演示可在:https://github.com/AI-S2-Lab/Chain-Talker 获取。

关键词

引用

@article{arxiv.2505.12597,
  title  = {Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis},
  author = {Yifan Hu and Rui Liu and Yi Ren and Xiang Yin and Haizhou Li},
  journal= {arXiv preprint arXiv:2505.12597},
  year   = {2025}
}

备注

16 pages, 5 figures, 5 tables. Accepted by ACL 2025 (Findings)