面向任务特定微调的拟核选择
计算机视觉与模式识别
2024-10-03 v1 图形学
摘要
任务特定微调是大语言模型(LLM)部署的必需环节, 但需要大量计算资源和时间。现有方法提出了核选取策略以提高数据效率并降低模型训练开销, 但仍存在局限性: 1) 在高剪枝率下忽视了有价值的样本, 导致核性能下降; 2) 在核选取过程中需要高时间开销以对目标LLM进行微调和评估。本文引入STAFF, 一种拟核选择方法。STAFF利用来自同一模型家族的小模型高效估计数据得分, 然后在目标LLM上验证这些得分, 以准确识别重要区域并分配更多选择预算, 同时保持易区域的覆盖。我们在三个LLMs和三个下游任务上评估STAFF, 结果表明STAFF在不同剪枝率下, 相较于SOTA方法在性能上提升最高可达54.3%, 选择开销降低最高可达70.5%。此外, 我们观察到在低剪枝率(即20%)下, STAFF选取的核即使优于完整数据集。
引用
@article{arxiv.2410.01295,
title = {LaGeM: A Large Geometry Model for 3D Representation Learning and Diffusion},
author = {Biao Zhang and Peter Wonka},
journal= {arXiv preprint arXiv:2410.01295},
year = {2024}
}
备注
For more information: https://1zb.github.io/LaGeM