中文

Fed-PISA:基于个性化身份-风格自适应的联邦语音克隆

声音 2026-02-10 v2 人工智能 音频与语音处理

摘要

文本到语音(TTS)的语音克隆旨在利用目标说话人的有限数据,从文本生成富有表现力且个性化的语音。联邦学习(FL)为该任务提供了一个协作且保护隐私的框架,但现有方法存在通信成本高的问题,且倾向于抑制风格异质性,导致个性化不足。为了解决这些问题,我们提出了 Fed-PISA,即联邦个性化身份-风格自适应。为了最小化通信成本,Fed-PISA 引入了解耦的低秩自适应(LoRA)机制:说话人的音色通过私有的 ID-LoRA 在本地保留,而仅将轻量级的 style-LoRA 传输到服务器,从而最小化参数交换。为了利用异质性,我们引入了一种受协同过滤启发的聚合方法,通过向风格相似的节点学习,为每个客户端创建定制模型。实验表明,Fed-PISA 提高了风格表现力、自然度和说话人相似度,以最小的通信成本优于标准联邦基线。

关键词

引用

@article{arxiv.2509.16010,
  title  = {Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation},
  author = {Qi Wang and Shituo Ma and Guoxin Yu and Hanyang Peng and Yue Yu},
  journal= {arXiv preprint arXiv:2509.16010},
  year   = {2026}
}

备注

Accepted by ICASSP 2026