Know When To Fold 'Em:基于多阶段飞行中拒绝的高效 Token LLM 合成数据生成
人工智能
2026-05-15 v1 计算与语言
摘要
尽管使用大语言模型(LLM)进行合成数据生成已广泛应用于后训练流程,但现有方法通常在应用质量过滤器之前生成完整输出,导致在最终被丢弃的样本上浪费了大量 token。为解决此问题,我们提出了多阶段飞行中拒绝(Multi-Stage In-Flight Rejection, MSIFR),这是一个轻量级、无需训练的框架,可在低质量生成轨迹到达完全完成之前的中间检查点检测并终止它们。MSIFR 将生成过程分解为顺序阶段,并应用快速的基于规则的验证器来识别算术不一致、幻觉模式和格式违规,从而实现对错误样本的早期拒绝。我们将飞行中拒绝形式化为一个序贯决策过程,并证明任何非平凡的丢弃策略都能减少预期的 token 消耗,且当拒绝发生在生成流程的较早阶段时,各阶段的节省量会增加。我们进一步证明,条件效用估计构成一个鞅,确保早期的飞行中拒绝不会使保留样本的预期效用产生偏差。在五个指令微调模型和七个推理基准上,MSIFR 作为独立方法减少了 11%-77% 的 token 消耗,当与提前退出方法结合时减少高达 78.2%,同时保持或提高了评估准确率。这些结果证实,MSIFR 提供了一种实用机制,无需额外训练或架构更改即可提高基于 LLM 的合成数据生成的效率。
引用
@article{arxiv.2605.14062,
title = {Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection},
author = {Anjir Ahmed Chowdhury and Syed Zawad and Feng Yan},
journal= {arXiv preprint arXiv:2605.14062},
year = {2026}
}
备注
17 pages, 4 figures, 7 tables