MimicLM:通过自回归建模伪平行语料实现零样本语音模仿
声音
2026-04-21 v2 计算与语言
摘要
语音模仿旨在转换源语音以匹配参考说话者的音色和说话风格,同时保留语言内容。一种直接的方法是对三元组(source、reference、target)进行训练,其中source和target共享相同内容,但target匹配reference的语音特征。然而,这种数据极其稀缺。现有方法要么采用精心设计的解耦架构来规避数据稀缺问题,要么利用外部系统合成伪平行训练数据。但前者需要复杂的模型设计,后者在使用合成语音作为训练目标时面临质量上限。为解决这些限制,我们提出MimicLM,采用一种新颖的方法:将合成语音用作训练源头,同时保留真实录音作为目标。这种设计使模型能够直接从真实语音分布中学习,突破合成语音的质量上限。基于这一数据构建方法,我们引入交错的文本-音频建模以引导生成内容准确的语音,并通过偏好对齐进行后训练,以缓解在合成数据上训练时的内在分布不匹配。实验表明,MimicLM以简单而有效的架构实现了卓越的语音模仿质量,在保持竞争性说话者身份、方言和情感维度相似度的同时,显著优于现有方法在自然度上的表现。
引用
@article{arxiv.2604.11552,
title = {MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora},
author = {Tao Feng and Yuxiang Wang and Yuancheng Wang and Xueyao Zhang and Dekun Chen and Chaoren Wang and Xun Guan and Zhizheng Wu},
journal= {arXiv preprint arXiv:2604.11552},
year = {2026}
}