基于流匹配的零样文本到语音笑声生成:让你想笑就笑
音频与语音处理
2024-03-06 v2 计算与语言
机器学习
声音
摘要
笑声是人类语音中最具表达性和自然性的方面之一,传递情感、社交线索和幽默感。然而,大多数文本到语音(TTS)系统缺乏产生逼真且恰当笑声的能力,限制了其应用和用户体验。虽然已有先前的工作试图生成自然笑声,但在控制笑声时机和种类方面不足。本文提出了ELaTE,一款零样文本到语音系统,能够基于简短的音频提示生成任何说话人的自然笑声语音,实现对笑声时机和表达的精确控制。具体而言,ELaTE利用音频提示模拟语音特征,利用文本提示指示生成语音的内容,利用输入控制笑声表达,这可以是笑声的开始和结束时间,或包含要模拟的笑声的额外音频提示。我们基于条件流匹配的零样文本到语音模型开发了我们的模型,并通过笑声检测器从帧级表示获得的额外条件进行微调。通过一种简单的方法将小规模笑声条件数据与大规模预训练数据混合,我们展示了预训练的零样文本到语音模型可以轻松微调以生成具有精确可控性的自然笑声,而不会损失预训练的零样文本到语音模型的任何质量。通过客观和主观评估,我们显示ELaTE能够生成语音质量和可控性显著高于常规模型的笑声。详见 https://aka.ms/elate/ 获取演示样本。
引用
@article{arxiv.2402.07383,
title = {Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like},
author = {Naoyuki Kanda and Xiaofei Wang and Sefik Emre Eskimez and Manthan Thakker and Hemin Yang and Zirun Zhu and Min Tang and Canrun Li and Chung-Hsien Tsai and Zhen Xiao and Yufei Xia and Jinzhu Li and Yanqing Liu and Sheng Zhao and Michael Zeng},
journal= {arXiv preprint arXiv:2402.07383},
year = {2024}
}
备注
See https://aka.ms/elate/ for demo samples, v2: subjective evaluation has been added