UniSpeaker: 一种多模态驱动说话人生成的统一方法
声音
2025-01-14 v1 人工智能
音频与语音处理
摘要
近年来,个性化语音生成的进展使合成语音越来越接近目标说话人录音的真实感,但多模态说话人生成仍在兴起。本文介绍了UniSpeaker,一种用于多模态驱动说话人生成的统一方法。具体来说,我们提出了一种基于KV-Former的统一语音聚合器,应用软对比损失将多种语音描述模态映射到共享语音空间,确保生成的语音与输入描述更紧密地对齐。为了评估多模态驱动的语音控制,我们构建了第一个基于多模态的语音控制(MVC)基准,重点关注语音适用性、语音多样性和语音质量。使用MVC基准在五个任务上评估UniSpeaker,实验结果表明UniSpeaker优于以前的特定模态模型。语音样本可在\url{https://UniSpeaker.github.io}获取。
引用
@article{arxiv.2501.06394,
title = {Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation},
author = {Zhengyan Sheng and Zhihao Du and Heng Lu and Shiliang Zhang and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2501.06394},
year = {2025}
}