中文

通过量化指令集的覆盖范围与深度加速大语言模型微调

人工智能 2025-10-29 v2

摘要

扩大监督微调(SFT)所用数据的规模并不一定保证模型性能按比例提升,这凸显了需要理解何种训练样本才是有效的关键需求。本工作识别了两种支配SFT可扩展性的基本数据属性:语义覆盖范围(semantic coverage),即任务域广度;信息深度(information depth),即单个示例的丰富程度。我们证明,这两种属性的简单代理变量能解释我们实验中绝大部分验证损失方差。本文进一步提出了信息景点逼近(Information Landscape Approximation, ILA),一种模型无关的数据选择框架,同时优化这两个因素。ILA构建紧凑子集,以逼近大数据集的信噪价值。实证结果表明,使用ILA所选数据调优的模型在 diverse 任务和模型规模上实现更快更持久的性能提升,我们称之为加速规模(accelerated scaling)。

关键词

引用

@article{arxiv.2509.06463,
  title  = {Accelerate Scaling of LLM Finetuning via Quantifying the Coverage and Depth of Instruction Set},
  author = {Chengwei Wu and Li Du and Hanyu Zhao and Yiming Ju and Jiapu Wang and Tianyu Chen and Haoyi Zhou},
  journal= {arXiv preprint arXiv:2509.06463},
  year   = {2025}
}