中文

论大规模指令调优数据选择中的表示冗余性

机器学习 2026-02-17 v1

摘要

数据质量是大型语言模型训练的关键因素。虽然已有研究表明,基于小规模高质量数据集训练的模型可优于基于大规模但噪声或低质量语料库训练的模型,但针对工业级指令调优数据选择的系统方法仍未得到充分探索。本文通过语义表示相似性的视角研究指令调优数据选择,识别出当前主流LLM编码器的一个关键局限:其产生高度冗余的语义嵌入。为缓解这种冗余,我们提出了压缩表示数据选择(Compressed Representation Data Selection, CRDS)框架,该框架包含两个变体。CRDS-R采用拉达维赫尔随机投影后拼接Transformer隐藏层表示,而CRDS-W采用基于白化的降维以提高表示质量。实验结果表明,两个变体均显著提升数据质量,持续超越现有基于表示的方法。值得注意的是,CRDS-W仅使用3.5%的数据即可实现优异性能,在四个数据集上平均超越完整数据基线0.71%。我们的代码已公开于https://github.com/tdano1/CRDS。

关键词

引用

@article{arxiv.2602.13773,
  title  = {On Representation Redundancy in Large-Scale Instruction Tuning Data Selection},
  author = {Youwei Shu and Shaomian Zheng and Dingnan Jin and Wenjie Qu and Ziyao Guo and Qing Cui and Jun Zhou and Jiaheng Zhang},
  journal= {arXiv preprint arXiv:2602.13773},
  year   = {2026}
}