CRAFT:基于聚类的回归用于训练数据自适应筛选
计算与语言
2026-04-27 v1 人工智能
摘要
从大型语料库中挑选出小且高质量的子集进行微调日益重要,因为语料规模可达数千万数据点,全量微调成本高昂且常常不必要。我们提出了 CRAFT(Clustered Regression for Adaptive Filtering of Training data),这是一种面向序列到序列模型的向量化无关的筛选方法。CRAFT 分解联合源-目标分布,执行两阶段筛选:(i) 通过在 k-means 聚类中按比例分配预算来匹配验证源分布,以及 (ii) 在每个源聚类内部,选择目标嵌入最小化从验证目标分布派生的条件期望距离的训练对。我们证明了比例聚类分配可界定选定分布与验证分布之间连续 KL 散度,剩余部分由聚类直径控制。我们在英-印地语翻译任务中对 CRAFT 进行评估,从 3300 万 NLLB 句子对中筛选训练数据并通过 LoRA 微调 mBART。CRAFT 实现了 43.34 BLEU 分数,超越 TSDS(41.21)2.13 分,同时筛选速度快 40 倍以上。使用 TF-IDF 向量化,整个管道可在 CPU 上在 1 分钟内完成。TAROT 实现了 45.61 BLEU,但 CRAFT 的筛选耗时仅 26.86 秒,远快于 TAROT 的 75.6 秒,快 2.8 倍。
引用
@article{arxiv.2604.22693,
title = {CRAFT: Clustered Regression for Adaptive Filtering of Training data},
author = {Parthasarathi Panda and Asheswari Swain and Subhrakanta Panda},
journal= {arXiv preprint arXiv:2604.22693},
year = {2026}
}