冰雪训练:交叉熵博弈中的梯度方法
人工智能
2026-05-28 v1
摘要
我们提出了冰雪训练(Frost Training),这是一种用于改进基于蒙特卡洛的方法在大型语言模型仿真任务中进行策略优化的技术。其核心思想是利用嵌入空间中奖励函数的梯度。这一信号被用于贪心坐标梯度(GCG)漏洞技术;我们首次展示了它也可用于提高模型训练。我们使用 GRPO 训练进行最大似然填充来验证我们的方法。冰雪训练提高了模型生成高得分输出的能力,在 best-of-k 设置下达到更高的最高分数,同时以更快的速度实现。
引用
@article{arxiv.2605.27701,
title = {Cross-Entropy Games and Frost Training},
author = {Arthur Renard and Franck Gabriel and Valentin Hartmann and Clément Hongler},
journal= {arXiv preprint arXiv:2605.27701},
year = {2026}
}
备注
14 pages, 6 figures