P3:面向 LLM 训练的数据修剪的政策驱动、节奏自适应与多样性促进框架
计算与语言
2024-10-21 v2
摘要
在快速发展的大语言模型(Large Language Model, LLM)领域,有效利用现有数据集进行微调以最大化模型潜力至关重要。本文引入 P3,一个以自适应框架旨在通过迭代数据修剪优化任务特定的微调过程。P3 由三个关键组件构成:(1)政策驱动的难度测量,基于模型的实时性能动态评估数据难度,将静态指标替换为可适应的评估;(2)节奏自适应选择,利用自适应学习逐步引入更具挑战性的数据,从而提升模型能力;(3)多样性促进,采用确定性点过程(Determinantal Point Process, DPP)确保数据在各时期的多样性,丰富学习过程。我们在推理场景中验证了 P3 的有效性,包括 APPS 和 MATH,显著优于传统数据修剪方法。通过推进动态数据选择和利用策略,P3 为 LLM 的性能提升提供了理论框架和具体方法,具有广泛的实用价值。
引用
@article{arxiv.2408.05541,
title = {P3: A Policy-Driven, Pace-Adaptive, and Diversity-Promoted Framework for data pruning in LLM Training},
author = {Yingxuan Yang and Huayi Wang and Muning Wen and Xiaoyun Mo and Qiuying Peng and Jun Wang and Weinan Zhang},
journal= {arXiv preprint arXiv:2408.05541},
year = {2024}
}