XEmoRAG:基于检索增强生成实现跨语言情感转移的可控强度
音频与语音处理
2025-08-13 v2
摘要
跨语言情感转移的零样本任务指的是基于来自不同源语言的参考语音,以表达目标语言情感生成语音。然而,该任务因缺乏平行多语言情感语料、外来语音色伴随着外语音调特征难以分离情感而仍具挑战性。本文提出XEmoRAG,一种新型框架,利用基于大语言模型(LLM)的模型实现从中文到泰语的零样本情感转移,无需依赖平行情感数据。XEmoRAG从中文语音中提取语言无关情感嵌入,并从精选的情感数据库中检索情感匹配的泰语语料,实现可控情感转移且无需显式情感标签。此外,流匹配对齐模块最小化基调和时长偏差,确保自然的韵律。该方法还将中文声纹混合到泰语合成中,提高节奏准确性和情感表达,同时保持说话人特征和情感一致性。实验结果表明,XEmoRAG仅使用中文参考音频即可合成情感表达自然的泰语语音,且无需显式情感标签。这些结果凸显了XEmoRAG在跨语言实现灵活低资源情感转移的能力。我们的演示已公开:https://tlzuo-lesley.github.io/Demo-page/。
引用
@article{arxiv.2508.07302,
title = {XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation},
author = {Tianlun Zuo and Jingbin Hu and Yuke Li and Xinfa Zhu and Hai Li and Ying Yan and Junhui Liu and Danming Xie and Lei Xie},
journal= {arXiv preprint arXiv:2508.07302},
year = {2025}
}
备注
Accepted by ASRU 2025