中文

迈向情感一致的基于文本的语音编辑:引入 EmoCorrector 与 ECD-TSE 数据集

音频与语音处理 2025-05-28 v1 人工智能 计算与语言 声音

摘要

基于文本的语音编辑(TSE)仅使用文本修改语音,免去了重新录制的需要。然而,现有的 TSE 方法主要关注合成语音片段的内容准确性和声学一致性,往往忽略了由文本更改引入的情感转变或不一致问题。为了解决这一问题,我们提出了 EmoCorrector,一种新颖的 TSE 后校正方案。EmoCorrector 利用检索增强生成(Retrieval-Augmented Generation, RAG),通过提取编辑后文本的情感特征,检索具有匹配情感的语音样本,并合成符合目标情感且保留说话人身份与质量的语音。为了支持 TSE 中情感一致性建模的训练和评估,我们率先构建了用于 TSE 的情感校正数据集(Emotion Correction Dataset for TSE, ECD-TSE)基准。ECD-TSE 的突出特点在于其包含了具有多样文本变化和一系列情感表达的 <<文本, 语音>> 配对数据。在 ECD-TSE 上的主观和客观实验及综合分析证实,EmoCorrector 显著增强了对目标情感的表达,同时解决了当前 TSE 方法中存在的情感不一致局限性。代码和音频示例可在 https://github.com/AI-S2-Lab/EmoCorrector 获取。

关键词

引用

@article{arxiv.2505.20341,
  title  = {Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset},
  author = {Rui Liu and Pu Gao and Jiatian Xi and Berrak Sisman and Carlos Busso and Haizhou Li},
  journal= {arXiv preprint arXiv:2505.20341},
  year   = {2025}
}

备注

INTERSPEECH2025. Code and audio examples: https://github.com/AI-S2-Lab/EmoCorrector