ZIP-FIT:基于压缩对齐的无嵌入数据选择
星系天体物理
2025-08-28 v2
摘要
数据选择对于优化语言模型(LM)在特定任务上的性能至关重要,然而现有方法往往未能有效考虑目标任务的数据分布。现有方法要么完全忽略目标任务分布,要么依赖无法捕捉诸如形式化(autoformalization)或代码生成等任务复杂模式的近似方法。一些确实考虑目标分布的方法,则依赖于如 n-gram 哈希等简单且可能有噪声的表示,这可能导致碰撞并引入噪声。我们提出 ZIP-FIT,一种数据选择方法,利用 gzip 压缩直接衡量训练数据与目标任务分布之间的对齐程度。在自动形式化和 Python 代码生成任务上的大量评估中,ZIP-FIT 显著优于 DSIR 和 D4 等领先基线。使用 ZIP-FIT 选择的数据训练的模型,其交叉熵损失达到最低点的速度比基线快高达 85.1%。此外,ZIP-FIT 的选择速度比 DSIR 快 65.8%,比 D4 快两个数量级。值得注意的是,ZIP-FIT 表明,规模较小但对齐良好的数据集往往优于规模更大但针对性较弱的数据集,凸显了高质量、针对性强的数据相对于海量低质量数据的优势。我们的工作表明,任务感知的数据选择对于高效的领域适应至关重要,而压缩提供了一种原则性的方法来衡量任务对齐度。通过展示针对性数据选择能显著提升任务特定性能,我们的研究为数据质量、任务对齐与模型学习效率之间的关系提供了新的见解。
关键词
引用
@article{arxiv.2410.18193,
title = {Characterising the z $\sim$ 7.66 Type-II AGN candidate SMACS S06355 using BEAGLE-AGN and JWST NIRSpec/NIRCam},
author = {M. S. Silcock and E. Curtis-Lake and D. J. B. Smith and I. E. B. Wallace and A. Vidal-García and A. Plat and M. Hirschmann and A. Feltre and J. Chevallard and S. Charlot and S. Carniani and A. J. Bunker},
journal= {arXiv preprint arXiv:2410.18193},
year = {2025}
}
备注
16 pages, 9 figures