后训练大规模模型中 Delta 参数编辑的统一视角
机器学习
2024-10-18 v1 计算与语言
摘要
后训练已成为一种关键范例,用于将大规模预训练模型适应各种任务,其效果完全体现在 delta 参数上,即后训练参数与预训练参数之间的差异。虽然已有许多研究探索了 delta 参数的特性,通过诸如修剪、量化、低秩近似和外推等操作,但缺乏一种统一框架来系统性地检查这些特性。在本文中,我们提出了一种新视角,基于对损失函数的 Riemann 汇积来阐明 delta 参数编辑操作。我们的分析将现有方法归类为三类,基于其 post-editing performance:竞争型、降级型和提升型,解释了它们是如何由 Riemann 汇积近似术语表达的,以及它们如何改变模型性能。在视觉和语言模型上进行的大量实验,包括 ViT、LLaMA 3、Qwen 2 和 Mistral,都支持了我们的理论发现。此外,我们对现有技术如 DARE 和 BitDelta 进行了扩展,揭示了这些技术在利用 delta 参数的特性方面的局限性,并将其重新组织为通用表达式,以提高后训练模型中 delta 参数编辑的适用性和有效性。
关键词
引用
@article{arxiv.2410.13841,
title = {A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models},
author = {Qiaoyu Tang and Le Yu and Bowen Yu and Hongyu Lin and Keming Lu and Yaojie Lu and Xianpei Han and Le Sun},
journal= {arXiv preprint arXiv:2410.13841},
year = {2024}
}