中文

面向噪声语音克隆与精确唇形同步合成的轻量级流水线

声音 2025-09-17 v1 人工智能

摘要

语音克隆与说话人头部生成的最新进展展示了合成自然语音和逼真唇形同步的卓越能力。当前方法通常需要大规模数据集和计算密集型流程,并使用干净的录音室录制输入,这在嘈杂或资源受限的环境中不可行。本文提出了一种新的模块化流水线,包含 Tortoise 文本转语音。它是一个基于 Transformer 的潜在扩散模型,仅需少量训练样本即可执行高保真零样本语音克隆。我们使用轻量级生成对抗网络架构来实现鲁棒的实时唇形同步。该解决方案将有助于许多关键任务,涉及减少对大规模预训练的依赖,以及在嘈杂和无约束场景下生成富有情感的语音和实现唇形同步。该流水线的模块化结构便于未来扩展多模态和文本引导的语音调制,并可用于现实世界系统。

关键词

引用

@article{arxiv.2509.12831,
  title  = {A Lightweight Pipeline for Noisy Speech Voice Cloning and Accurate Lip Sync Synthesis},
  author = {Javeria Amir and Farwa Attaria and Mah Jabeen and Umara Noor and Zahid Rashid},
  journal= {arXiv preprint arXiv:2509.12831},
  year   = {2025}
}