中文

DoGE:基于泛化估计的领域重加权

机器学习 2024-02-06 v2 人工智能 计算与语言

摘要

预训练数据的覆盖与组成显著影响大语言模型(LLMs)的泛化能力。尽管重要,近期 LLMs 仍依赖启发式与试错来增减数据领域的影响。我们提出基于泛化估计的领域重加权(DoGE),其以原则性方式优化从各领域采样的概率(领域权重)。我们的方法为两阶段过程:(i)训练代理模型以使用双层优化算法获得领域权重;(ii)依据所学领域权重采样训练领域来训练更大的基模型。在实验中,我们充分展示了 DoGE 如何改进基模型对任意目标数据混合的泛化。在 SlimPajama 数据集上,相较基线方法,我们的基模型在 66 项任务上获得更好的困惑度与少样本推理准确率。此外,旨在泛化至预训练语料中未见过的域外目标任务(OOD 领域),DoGE 能有效识别领域间依赖,并在目标领域上一致取得更好的测试困惑度。

关键词

引用

@article{arxiv.2310.15393,
  title  = {DoGE: Domain Reweighting with Generalization Estimation},
  author = {Simin Fan and Matteo Pagliardini and Martin Jaggi},
  journal= {arXiv preprint arXiv:2310.15393},
  year   = {2024}
}