KCM:基于KAN的协作模型增强预训练大模型
机器学习
2025-10-24 v1
摘要
近年来,预训练大模型(PLM)研究者提出了大小模型协作框架,利用易于训练的小模型辅助大模型,旨在(1)在保持相当精度的同时显著降低计算资源消耗,以及(2)提升大模型在特定领域任务上的性能。然而,这种协作范式存在精度显著下降、灾难性遗忘加剧以及小模型知识引发的幻觉问题放大等问题。为应对这些挑战,我们提出了一种基于KAN的协作模型(KCM),作为大小模型协作的一种改进方法。KCM中使用的KAN是一种不同于传统MLP的替代神经网络架构。与MLP相比,KAN具有更优的可视化和可解释性,同时能缓解灾难性遗忘。我们在语言、视觉以及视觉-语言跨模态任务三种场景下,将KCM部署于大小模型协作系统中。实验结果表明,与纯大模型方法相比,使用KCM作为协作模型的大小模型协作框架,在保持几乎相同的任务精度的同时,显著减少了大模型推理调用的次数,从而大幅降低了计算资源消耗。同时,基于KAN的小型协作模型显著缓解了灾难性遗忘,从而显著提升了长尾数据的精度。结果显示,KCM在所有指标上均优于基于MLP的小型协作模型(MCM)。
引用
@article{arxiv.2510.20278,
title = {KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models},
author = {Guangyu Dai and Siliang Tang and Yueting Zhuang},
journal= {arXiv preprint arXiv:2510.20278},
year = {2025}
}