中文

基于上下文学习的 Holdout-Loss 数据选择用于 LLM 微调

机器学习 2026-01-28 v2 人工智能

摘要

微调大型预训练语言模型是将其与人类偏好对齐的常见方法,但噪声或不相关的示例会稀释监督信息。虽然小型、精选的数据集常能匹配大型数据集的性能,但系统且高效地识别高价值训练数据的办法仍未得到充分探索。许多当前方法依赖启发式方法或昂贵的重新训练。我们提出了一种原则且资源高效的数据选择和重加权框架。其核心是一种上下文近似 (In-Context Approximation, ICA),通过在上下文中对小型、精选的持留集进行条件化来估计模型在训练候选示例后所产生的持留损失。ICA无需参考模型,也无需额外微调。我们将得到的估计定义为ICA得分,并推导出每条示例的权重,以便在模型参数演化的过程中动态重加权梯度更新。在SFT、DPO和SimPO上,以及在多样化的模型架构和数据集上,基于ICA的重加权 consistently 改进了模型对齐,同时几乎没有额外开销。我们分析了得分更新频率和上下文持留示例数量的敏感性。我们也讨论了在快速变化的在策略设置中的局限性,揭示了未来工作的方向。代码和提示将公开发布。

关键词

引用

@article{arxiv.2510.14459,
  title  = {Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning},
  author = {Ling Zhang and Xianliang Yang and Juwon Yu and Park Cheonyoung and Miran Lee and Lei Song and Jiang Bian},
  journal= {arXiv preprint arXiv:2510.14459},
  year   = {2026}
}