KIND: 用于训练可分解模型的知识集成与分流
计算机视觉与模式识别
2025-05-21 v2
摘要
预训练模型已成为首选骨干网络,因为模型参数日益复杂。然而,传统预训练模型由于其固定大小而面临部署挑战,并且当训练任务与目标任务之间存在差异时容易发生负迁移。为解决这一问题,我们提出了KIND,一种用于构建可分解模型的新型预训练方法。KIND通过将奇异值分解(SVD)作为结构约束来集成知识,每个基本组件表示为U、Σ和V^⊤矩阵中的列向量、奇异值和行向量的组合。这些组件被分为learngenes(封装类无关知识)和tailors(捕获类特定知识),并通过训练过程中的类别门机制实现知识分流。大量实验表明,用KIND预训练的模型可以分解为learngenes和tailors,这些组件可以自适应地重新组合以适应多样化的资源受限部署。此外,对于存在大领域偏移的任务,仅迁移包含任务无关知识的learngenes,并结合随机初始化的tailors,可以有效缓解领域偏移。代码将在https://github.com/Te4P0t/KIND上公开。
引用
@article{arxiv.2408.07337,
title = {KIND: Knowledge Integration and Diversion for Training Decomposable Models},
author = {Yucheng Xie and Fu Feng and Ruixiao Shi and Jing Wang and Yong Rui and Xin Geng},
journal= {arXiv preprint arXiv:2408.07337},
year = {2025}
}