基于特征特定部分微调的LLM语音合成中的高效情感与说话人适应
音频与语音处理
2026-03-09 v2 声音
摘要
尽管LLM-based语音合成模型在零样本情感和说话人克隆方面表现出色,但在未见域上的克隆保真度和发音清晰度仍下降。微调对于适应至关重要,但统一的方法忽略了特定参数贡献。对有限数据进行统一调参会导致训练缓慢并出现灾难性遗忘,进而导致发音准确性下降。为此,我们提出了特征特定部分微调策略(CSP-FT)。通过加权求和动态分析各层贡献,我们仅对捕获最高和最低情感及说话人信息的两层进行微调,既最大化前者的效用,又显式加强后者的容量。实验在由11个数据集组成的综合语料库上进行,结果表明CSP-FT在保持或超越全参数微调的保真度和可读性方面具有优势,仅更新约8%的参数即可加快训练约2倍,并显著缓解灾难性遗忘。
引用
@article{arxiv.2501.14273,
title = {Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning},
author = {Tianrui Wang and Meng Ge and Cheng Gong and Chunyu Qiang and Haoyu Wang and Zikang Huang and Yu Jiang and Ye Ni and Yuheng Lu and Xiaobao Wang and Engsiong Chng and Xie Chen and Longbiao Wang and Jianwu Dang},
journal= {arXiv preprint arXiv:2501.14273},
year = {2026}
}
备注
10 pages