面向表现力对话语音合成的检索增强对话知识聚合
计算与语言
2025-01-14 v1
摘要
对话语音合成旨在以当前对话历史为参考,合成符合对话风格的表现力语音。与CD不同,存储对话包含早期用户-智能体交互中保留的对话片段,其中包含与CD中类似场景相关的风格表达知识。注意,该知识在使智能体合成产生共情反馈的表现力对话语音方面起着重要作用。然而,先前的研究忽略了这一方面。为了解决这个问题,我们提出了一种用于表现力CSS的新型检索增强对话知识聚合方案,称为RADKA-CSS,它包含三个主要部分:1)为了从SD中有效地检索在语义和风格上均与CD相似的对话。首先,我们构建了一个存储对话语义-风格数据库,其中包含文本和音频样本。然后,我们设计了一种多属性检索方案,将CD的对话语义和风格向量与SDSSD中存储的对话语义和风格向量进行匹配,检索出最相似的对话。2)为了有效利用来自CD和SD的风格知识,我们提议采用多粒度图结构来编码对话,并引入多源风格知识聚合机制。3)最后,聚合的风格知识被输入到语音合成器中,以帮助智能体合成符合对话风格的表现力语音。我们基于DailyTalk数据集进行了全面深入的实验,该数据集是CSS任务的基准数据集。客观和主观评估均表明,RADKA-CSS在表现力渲染方面优于基线模型。代码和音频样本可在以下网址找到:https://github.com/Coder-jzq/RADKA-CSS。
引用
@article{arxiv.2501.06467,
title = {Retrieval-Augmented Dialogue Knowledge Aggregation for Expressive Conversational Speech Synthesis},
author = {Rui Liu and Zhenqi Jia and Feilong Bao and Haizhou Li},
journal= {arXiv preprint arXiv:2501.06467},
year = {2025}
}
备注
Accepted by Information Fusion 2025