面向线性复杂度的预训练语音与语言模型联合微调与转换
计算与语言
2025-03-14 v4 人工智能
机器学习
声音
音频与语音处理
摘要
诸如Linformer和Mamba等架构最近作为transformer的线性时间替代方案涌现出来。然而,通常缺乏对应的数据预训练模型,尤其是在非文本领域。为此,我们提出一种Cross-Architecture Layerwise Distillation(CALD)方法,该方法在联合转换transformer模型为线性时间替代方案和微调到目标任务方面发挥作用。我们还比较了几种引导微调以充分保留原始模型所需推理能力的方法。这些方法在其对目标模型的使用方式以及参数轨迹方面存在差异。在一系列关于语言处理、语言建模和语音处理的实证研究中,我们表明CALD能够有效恢复原始模型的结果,并且引导策略对结果有所贡献。我们还提供了一些解释差异原因。
关键词
引用
@article{arxiv.2410.06846,
title = {Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity},
author = {Mutian He and Philip N. Garner},
journal= {arXiv preprint arXiv:2410.06846},
year = {2025}
}
备注
18 pages, 5 figures; ICLR 2025 camera ready. Code: https://github.com/idiap/linearize-distill-pretrained-transformers