中文

G-DIG:面向机器翻译的基于梯度的多样且高质量指令数据选择

计算与语言 2024-07-09 v2

摘要

大型语言模型(LLM)在一般场景中展现了卓越的能力。指令微调使它们能够在各种任务中与人类对齐。然而,指令数据的多样性和质量仍然是指令微调的两个主要挑战。针对这一点,在本文中,我们提出了一种新颖的基于梯度的方法,用于自动选择高质量且多样化的指令微调数据以进行机器翻译。我们的关键创新在于分析单个训练样本在训练过程中如何影响模型。具体来说,我们通过影响函数加上一个小的高质量种子数据集,选择对模型产生有益影响的训练样本作为高质量样本。此外,为了增强训练数据的多样性,我们通过对梯度进行聚类并重新采样,最大化它们对模型影响的多样性。在WMT22和FLORES翻译任务上的大量实验证明了我们方法的优越性,深入分析进一步验证了它们的有效性和泛化能力。

关键词

引用

@article{arxiv.2405.12915,
  title  = {G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation},
  author = {Xingyuan Pan and Luyang Huang and Liyan Kang and Zhicheng Liu and Yu Lu and Shanbo Cheng},
  journal= {arXiv preprint arXiv:2405.12915},
  year   = {2024}
}

备注

Accepted to ACL 2024 main conference