面向语音语言模型的灾难性遗忘缓解策略分析
计算与语言
2025-05-26 v1 人工智能
机器学习
声音
音频与语音处理
摘要
语音语言模型(SLM)的端到端训练通常涉及将预训练的文本型大型语言模型(LLM)适配到语音模态,通过在ASR、TTS和 spoken question answering(SQA)等多样化任务上的多阶段训练来实现。尽管这种多阶段持续学习为LLM提供了语音理解和生成能力,但跨阶段任务和数据分布的显著差异可能导致灾难性遗忘,即先前获取的知识丢失。本文调查了灾难性遗忘现象,评估了三种缓解策略——模型合并、缩放因子贴现和经验回放,以在知识保留与新学习之间取得平衡。结果表明,经验回放最为有效,进一步通过与其他方法的组合可获得额外提升。这些发现为开发更稳健和高效的SLM训练管道提供了见解。
引用
@article{arxiv.2505.17496,
title = {Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models},
author = {Chi-Yuan Hsiao and Ke-Han Lu and Kai-Wei Chang and Chih-Kai Yang and Wei-Chih Chen and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.17496},
year = {2025}
}
备注
Accepted to Interspeech 2025