DREAM-R:基于RL的多模态推断性推理框架
人工智能
2026-05-28 v1
摘要
推断性推理最近被提出作为加速大型多模态模型中推理密集型生成的手段,但其效果常受制于推断草稿与目标验证推理之间的错位。在本工作中,我们引入 DREAM-R 框架显著性地提高了推断性推理的性能。其核心,DREAM-R 采用 Speculative Alignment Policy Optimization(SAPO),一个强化学习目标,训练 draft 模型生成既忠于目标轨迹又简洁的推理步骤。我们进一步提出基于阈值的验证机制(TBVM),其采用比率准则仅在积极证据明显占优时提供稳定且可解释的推断步骤接受,从而防止误差传播。建立在这些组件之上,我们开发了完全并行的推断性推理(FPSR)框架,对推断草稿生成、目标侧推理和验证在多步骤推理中进行并行化,实现早期停止和干净的回退。在推理密集型基准测试上的实验表明,DREAM-R 在保持目标模型准确性的同时实现了最高加速,显著提升了效率而不牺牲推理质量。
引用
@article{arxiv.2605.28678,
title = {DREAM-R: Multimodal Speculative Reasoning with RL-Based Refined Drafting, Precise Verification, and Fully Parallel Execution},
author = {Yunhai Hu and Zining Liu and Xiangyang Yin and Tianhua Xia and Bo Bao and Eric Sather and Vithursan Thangarasa and Sai Qian Zhang},
journal= {arXiv preprint arXiv:2605.28678},
year = {2026}
}