LEAD:高效 LLM 指令调优的迭代数据选择
机器学习
2025-05-13 v1 人工智能
数据库
摘要
指令调优已成为提高大型语言模型(LLM)能力和对齐性的关键范式。然而,现有的迭代模型感知数据选择方法计算开销巨大,因为它们依赖于重复进行完整数据集模型推断来估计后续训练迭代中样本的实用性,形成了根本性的效率瓶颈。本文提出了 LEAD,一个高效的迭代数据选择框架,能够准确地在标准训练循环中估计样本实用性,无需额外的模型推断。LEAD 的核心引入了实例级动态不确定性(IDU),这是一种在理论上得到支撑的实用函数,结合了即时训练损失、对损失变化的梯度近似以及历史损失信号的指数平滑。为了进一步高效地扩展到大规模数据集,LEAD 采用两阶段、从粗到细的选择策略,通过多臂老虎机机制自适应地优先排序信息丰富的簇,然后使用 IDU 对高实用性样本进行精细选择。广泛的实验表明,LEAD 显著优于最先进的方法,在仅使用 2.5% 训练数据的情况下,通过减少 5-10 倍的整体训练时间,使平均模型性能提高 6.1%-10.8%。
引用
@article{arxiv.2505.07437,
title = {LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning},
author = {Xiaotian Lin and Yanlin Qi and Yizhang Zhu and Themis Palpanas and Chengliang Chai and Nan Tang and Yuyu Luo},
journal= {arXiv preprint arXiv:2505.07437},
year = {2025}
}