中文

指令集信息边界的扩展:Infinity Instruct Subject 技术报告

人工智能 2026-02-12 v4 计算与语言

摘要

指令调谐已成为解锁大规模预训练模型能力、提升其在复杂任务上的性能的基础因素。因此,构建高质量的指令数据集对于增强模型性能和通用性至关重要。尽管当前指令数据集已达到数十万规模,但在复杂指令遵循和稀有领域任务方面,模型仍可能表现不足。这主要源于指令集在“覆盖范围”(任务类型和知识领域的覆盖)和“深度”(指令复杂度)上的有限扩张。为此,我们提出了一套系统化的指令数据构建框架,集成了分层标签系统、信息性种子选择算法、演化数据合成过程以及针对性数据生成的模型缺陷诊断。这些组件构成一个不断增强指令数据覆盖范围和深度的迭代闭环。基于此框架,我们构建了包含约 150 万条指令的 Infinity Instruct Subject 数据集。多项基准任务和实验表明,该数据集在提升指令遵循能力方面有效。进一步分析表明,Infinity Instruct Subject 在可比合成指令数据集中展现出更大的覆盖范围和深度。我们的工作为高效、持续的指令数据集演进提供了理论与实践基础,推动从数据数量的扩张转向质量的提升。

关键词

引用

@article{arxiv.2507.06968,
  title  = {Scaling Towards the Information Boundary of Instruction Sets: The Infinity Instruct Subject Technical Report},
  author = {Li Du and Hanyu Zhao and Yiming Ju and Tengfei Pan},
  journal= {arXiv preprint arXiv:2507.06968},
  year   = {2026}
}