强化上下文顺序恢复用于自适应推理与规划
计算与语言
2025-08-19 v1 人工智能
摘要
现代因果语言模型,跟随离散扩散模型的快速发展,现在可以产生多种有趣且有用的内容。然而,这些模型家族主要训练用于以固定(从左到右)或随机顺序输出标记,这可能偏离标记最初生成的逻辑顺序。在本文中,我们注意到当前因果和扩散模型在需要自适应标记生成顺序才能可行解决的问题时遇到了困难,我们用 -信息框架对此进行了表征。针对这一点,我们提出了强化上下文顺序恢复 (ReCOR),一个基于强化学习的框架,用于在无注释的情况下从文本数据中提取自适应、数据依赖的标记生成顺序。通过标记预测统计的自监督方式,ReCOR估计每个未填充标记的预测难度,并在训练和推理期间自适应选择下一个标记。在具有挑战性的推理和规划数据集上进行的实验表明,ReCOR相对于基线方法表现出优越性能,有时甚至超过受地面真实顺序监督的oracle模型。
引用
@article{arxiv.2508.13070,
title = {Reinforced Context Order Recovery for Adaptive Reasoning and Planning},
author = {Long Ma and Fangwei Zhong and Yizhou Wang},
journal= {arXiv preprint arXiv:2508.13070},
year = {2025}
}