中文

训练后大语言模型的离线数据选择与在线自优化生成的统一理解

机器学习 2025-11-27 v1 计算与语言 最优化与控制

摘要

离线数据选择与在线自优化生成是提升数据质量的关键步骤,对于将大语言模型(LLMs)适配到特定下游任务至关重要。我们从优化视角入手处理离线数据选择与在线自优化生成。具体而言,双层数据选择用于针对验证数据集的离线数据选择,我们将在线自优化生成视为选择当前响应所训练的、最适配验证数据的模型这一模型适配步骤。我们的框架通过为每个问题和响应赋予学习到的数据权重(显式或隐式),为离线数据选择与自优化生成提供了统一理解。我们首次从理论上证明了双层数据选择框架的有效性,并展示了其相对于未过滤直接混合基线的性能提升。通过将离线数据与验证加权在线生成相结合,我们的方法增强了微调性能。在质量增强与安全感知LLM微调上的实验验证了其有效性。

关键词

引用

@article{arxiv.2511.21056,
  title  = {A Unified Understanding of Offline Data Selection and Online Self-refining Generation for Post-training LLMs},
  author = {Quan Xiao and Tianyi Chen},
  journal= {arXiv preprint arXiv:2511.21056},
  year   = {2025}
}