GIO:用于训练数据集选择的梯度信息优化
机器学习
2024-07-30 v3 人工智能
摘要
由于在可用训练样本中样本质量参差不齐,或者希望在不牺牲性能的前提下使用更少样本进行训练,通常在可用训练样本的 subset 上训练模型是有利的。我们提出梯度信息优化(GIO),这是一种可扩展、任务无关的数据选择方法,仅需一小部分代表目标分布的(未标记)样本。GIO 始于一个自然的、信息论意义上的目标函数,该函数在实践中难以处理。我们的贡献在于通过简单地松弛该目标函数并辅以高效实现,使其具有高度可扩展性。在机器翻译、拼写纠正和图像识别的实验中,我们表明 GIO 在极小的训练集下即可取得出色结果。这些发现对不同的表示模型及 GIO 自身的超参数均具有鲁棒性。GIO 任务与领域无关,可开箱即用地应用于新数据集与领域。我们以 "pip install grad-info-opt" 开源了该算法的 pip 可安装实现。
引用
@article{arxiv.2306.11670,
title = {GIO: Gradient Information Optimization for Training Dataset Selection},
author = {Dante Everaert and Christopher Potts},
journal= {arXiv preprint arXiv:2306.11670},
year = {2024}
}
备注
ICLR 2024 Spotlight paper