面向内存高效模型合并的任务向量量化
机器学习
2025-08-08 v2
摘要
模型合并通过组合特定任务的微调检查点来实现高效的多任务模型。然而,存储多个特定任务的检查点需要大量内存,限制了可扩展性,并将模型合并局限于更大的模型和多样的任务。在本文中,我们提出量化任务向量(即预训练检查点与微调检查点之间的差异),而不是量化微调检查点。我们观察到任务向量表现出较窄的权重范围,能够在现有的任务向量合并框架内实现低精度量化(例如 4 bit)。为了进一步减轻超低比特精度(例如 2 bit)下的量化误差,我们引入了残差任务向量量化,将任务向量分解为基向量和偏移分量。我们根据量化敏感性分配比特,在内存预算内确保精度同时最小化误差。在图像分类和密集预测上的实验表明,我们的方法在使用全精度检查点所需内存的 8% 的情况下,保持或提升了模型合并的性能。
引用
@article{arxiv.2503.06921,
title = {Task Vector Quantization for Memory-Efficient Model Merging},
author = {Youngeun Kim and Seunghwan Lee and Aecheon Jung and Bogon Ryu and Sungeun Hong},
journal= {arXiv preprint arXiv:2503.06921},
year = {2025}
}