面向大语言模型的热火启动与定期执行采样
机器学习
2025-02-17 v2 人工智能
计算与语言
摘要
自 ChatGPT 发布以来,大语言模型 (LLMs) 在众多领域展现出卓越的能力。开发这些通用能力的一个关键挑战是高效地获取多样且高质量的数据。这在涉及沙盒检查器的推理相关任务(如数学或代码)中尤为关键,其目标是生成正确解决方案的概率更高。在这项工作中,我们引入了热烈启动与定期执行 (FIRE) 采样,这是一种简单但非常有效的方法,用于高效地寻找优质回复。我们的实证发现表明,FIRE 采样不仅提升了推理时的生成质量,也有利于对齐阶段的训练。此外,我们探索了 FIRE 采样如何通过促进多样性来提升性能,并分析了在回复中的不同位置采用 FIRE 的影响。
引用
@article{arxiv.2410.21236,
title = {Flaming-hot Initiation with Regular Execution Sampling for Large Language Models},
author = {Weizhe Chen and Zhicheng Zhang and Guanlin Liu and Renjie Zheng and Wenlei Shi and Chen Dun and Zheng Wu and Xing Jin and Lin Yan},
journal= {arXiv preprint arXiv:2410.21236},
year = {2025}
}