基于轨迹匹配的可迁移文本数据蒸馏
计算与语言
2025-04-25 v2
摘要
在大型语言模型(LLM)领域,随着大型模型的规模增大,也带来更高的训练成本。亟需最小化LLM训练中的数据规模。与数据选择方法相比,数据蒸馏方法旨在合成少量数据样本,以实现完整数据集的训练效果,并且具有更好的灵活性。尽管在计算机视觉中取得了成功,但文本数据的离散性一直限制了其在自然语言处理(NLP)中的探索。本文提出了一种基于轨迹匹配学习伪提示数据并寻找其最近邻ID以实现跨架构迁移的方法。在蒸馏过程中,我们引入正则化损失以提高提炼数据的鲁棒性。到目前为止,鲜有适用于指令调优等文本生成任务的数据蒸馏工作。在两个基准测试中,包括ARC-Easy和MMLU指令调优数据集上的评估表明,我们的蒸馏方法优于SOTA数据选择方法LESS。此外,我们的方法在LLM结构之间(即OPT到Llama)显示出良好的迁移性。
引用
@article{arxiv.2504.09818,
title = {Transferable text data distillation by trajectory matching},
author = {Rong Yao and Hailin Hu and Yifei Fu and Hanting Chen and Wenyi Fang and Fanyi Du and Kai Han and Yunhe Wang},
journal= {arXiv preprint arXiv:2504.09818},
year = {2025}
}