IDEAL:数据均衡适应的多能力语言模型对齐框架
人工智能
2025-05-20 v1
摘要
大型语言模型 (LLM) 由于在多样化指令数据集上的监督微调 (SFT) 已取得令人瞩目的性能。当同时在多个能力上进行训练时,由不同领域数据组成的混合训练数据集是一个关键因素,直接影响最终模型的性能。与众多聚焦通过数据选择方法提升训练数据质量的研究不同,很少有研究探索混合训练数据集中各领域数据组成与 LLM 各类能力之间的复杂关系。鉴于高质量多域训练数据集的可用性,理解各领域数据对模型整体能力的影响对于准备 SFT 数据并训练在各领域任务上都能有效发挥作用的模型至关重要。本文介绍了 IDEAL,一种创新的数据均衡适应框架,旨在有效优化混合 SFT 数据集中来自不同领域的数据体积,从而提升模型在多能力上的对齐与性能。IDEAL 采用基于梯度的方法,迭代细化训练数据分布,动态调整各领域数据体积,这取决于其对下游任务性能的影响。通过利用这一自适应机制,IDEAL 确保数据集组成的平衡,使模型能够在 diverse 任务上实现稳健的泛化和持续的专业能力。跨多个能力的实验表明,IDEAL 优于常规统一数据分配策略,实现了约 7% 的综合性能提升。
引用
@article{arxiv.2505.12762,
title = {IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment},
author = {Chenlin Ming and Chendi Qu and Mengzhang Cai and Qizhi Pei and Zhuoshi Pan and Yu Li and Xiaoming Duan and Lijun Wu and Conghui He},
journal= {arXiv preprint arXiv:2505.12762},
year = {2025}
}