中文

选择学习与学习选择:比特串生成中的最佳-N 与监督微调

机器学习 2026-03-31 v2 机器学习

摘要

以比特串生成问题为案例研究,我们理论上比较两种标准的大语言模型适配新任务的方法。第一种方法称为监督微调,涉及在优质生成结果上训练新的下一个标记预测器。第二种方法为最佳-N(Best-of-N),通过训练奖励模型从未修改的基础模型生成的集合中选择优质响应。若学习环境是可实现的,我们发现监督微调通过其在响应长度上的更好收敛依赖优于 BoN。若不可实现性失败,BoN 可能在 n 或收敛率(对响应长度依赖更好)上获得更好的收敛率。

关键词

引用

@article{arxiv.2505.17288,
  title  = {Learning to Choose or Choosing to Learn: Best-of-N vs. Supervised Fine-Tuning for Bit String Generation},
  author = {Seamus Somerstep and Vinod Raman and Unique Subedi and Yuekai Sun},
  journal= {arXiv preprint arXiv:2505.17288},
  year   = {2026}
}

备注

AISTATS 2026 Camera Ready