中文

DAJ: 用于代码生成测试时扩展的数据重写型 LLM 评判器

机器学习 2026-02-02 v1

摘要

测试时扩展的编码生成通常依赖于 Best-of-N 选择,即从基础模型中采样多个候选解 solution,并由 LLM 评判器选择最佳一个。然而,由于严重的分布偏移,包括易问题和难问题之间的不平衡、训练任务与评估基准之间的不匹配,以及由于训练数据由较便宜模型生成,其行为不同于推理时的模型导致训练可靠的 LLM 评判器具有挑战。我们提出 DAJ,一个基于可验证奖励的 LLM 评判器,在双层数据重写学习框架下进行训练。该框架学习数据重要性权重(要么是域级,要么是实例级),以优化在与目标基准对齐的保留的 meta 集上的泛化性能。鉴于本文是首次将数据重写应用于 LLM 作为评判器训练以进行测试时扩展,我们的方法自动强调困难问题、分布内样本以及与轨迹对齐的数据,而无需依赖手工制作的启发式方法。经验上,DAJ 在 LiveCodeBench 和 BigCodeBench 上实现了最新的性能,优于强大的测试时扩展基线以及领先的专有模型。

关键词

引用

@article{arxiv.2601.22230,
  title  = {DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation},
  author = {Peijia Qin and Ruiyi Zhang and Qi Cao and Pengtao Xie},
  journal= {arXiv preprint arXiv:2601.22230},
  year   = {2026}
}