Optimsyn: 基于影响引导的评分标准优化用于合成数据生成
计算与语言
2026-04-02 v1 人工智能
摘要
大语言模型(LLM)由于丰富的监督微调(SFT)数据而展现出强大的下游性能。然而,在人文、社会科学、医学、法律和金融等知识密集型领域,高质量的SFT数据稀缺,因为专家标注成本高昂、隐私约束严格且标签一致性难以保证。近期工作通过提示生成器处理领域文档并使用手工设计的评分标准过滤输出来生成合成数据。然而,评分标准设计依赖专家,跨领域迁移性差,且通常通过编写评分标准、合成数据、训练、检查结果和手动猜测修订的脆弱启发式循环进行优化。这一过程缺乏关于评分标准如何影响下游性能的可靠定量反馈。我们提出通过评估合成数据在目标模型上的训练效用来衡量其质量,并利用这一信号指导数据生成。受影响估计的启发,我们采用一种优化器感知估计器,利用梯度信息量化每个合成样本对目标模型在特定任务上目标的贡献。我们的分析表明,即使合成样本与真实样本在嵌入空间中接近,它们对学习的影响也可能存在显著差异。基于这一洞察,我们提出了一种基于优化的框架,利用目标模型反馈自适应调整评分标准。我们提供轻量级引导文本,并使用评分标准专用模型生成任务条件化的评分标准。影响得分作为奖励,通过强化学习优化评分标准生成器。跨领域、目标模型和数据生成器的实验表明,该方法具有一致性的提升和强泛化能力,且无需任务特定调优。
引用
@article{arxiv.2604.00536,
title = {Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation},
author = {Zhiting Fan and Ruizhe Chen and Tianxiang Hu and Ru Peng and Zenan Huang and Haokai Xu and Yixin Chen and Jian Wu and Junbo Zhao and Zuozhu Liu},
journal= {arXiv preprint arXiv:2604.00536},
year = {2026}
}