GradientSpace: 用于改进指令调优的无监督数据聚类
机器学习
2025-12-09 v1 人工智能
摘要
指令调优是将大型语言模型(LLMs)适配到广泛下游应用的关键步骤之一。然而,该过程困难,因为真实世界数据集很少是同质的;它们由多样化信息的混合组成,导致梯度干扰,即冲突的梯度将模型拉向相反方向,降低性能。缓解此问题的常见策略是基于语义或嵌入相似性对数据进行分组。然而,这无法捕捉数据在学习过程中如何影响模型参数。虽然近期工作尝试直接对梯度进行聚类,但它们随机将梯度投影到低维空间以管理内存,这导致了精度损失。此外,这些方法依赖专家集成,这需要多次推理遍历和推理期间昂贵的在线梯度计算。为解决这些局限性,我们提出 GradientSpace,一个直接在全维梯度空间中对样本进行聚类的框架。我们引入了一种基于在线 SVD 的算法,在 LoRA 梯度上运行,以识别潜在技能,而无需存储所有样本梯度的不可行成本。每个聚类用于训练一个专门的 LoRA 专家,以及一个在推理期间选择最佳专家的轻量级路由器。我们表明,路由到单个合适的专家优于先前工作中使用的专家集成,同时显著降低了推理延迟。我们在数学推理、代码生成、金融和创意写作任务上的实验表明,GradientSpace 实现了连贯的专家专业化和相对于最先进聚类方法和微调技术的持续精度提升。
引用
@article{arxiv.2512.06678,
title = {GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning},
author = {Shrihari Sridharan and Deepak Ravikumar and Anand Raghunathan and Kaushik Roy},
journal= {arXiv preprint arXiv:2512.06678},
year = {2025}
}