中文

ConsistentRFT:降低基于流的强化微调中的视觉幻觉

计算机视觉与模式识别 2026-02-04 v1

摘要

基于流模型的强化微调(RFT)对于偏好对齐至关重要,但常会引入视觉幻觉,如过度优化细节和语义错位。本文初步探讨视觉幻觉的产生原因及其消除方法。我们首先从统一的视角考察 RFT 方法,揭示其源自两个方面的核心问题:探索与开发(1)在随机微分方程(SDE)rollouts 中受限的探索,导致对局部细节过度关注而牺牲全局语义,以及(2)策略梯度方法固有的轨迹模仿过程,扭曲模型的基础向量场及其跨步骤一致性。基于此,我们提出 ConsistentRFT,一个缓解这些幻觉的通用框架。具体而言,我们设计了动态粒度 rollout(DGR)机制,通过动态调度不同噪声源来平衡全局语义与局部细节之间的探索。随后,我们引入 Consistent Policy Gradient Optimization(CPGO),通过与更稳定的先验对齐来保持模型的一致性。大量实验表明,ConsistentRFT 显著降低了视觉幻觉,分别将低层和高层感知幻觉平均降低 49% 和 38%。此外,ConsistentRFT 在 out-of-domain 指标上优于其他 RFT 方法,相较于 baseline 的 -0.4% 改进 5.1%。

关键词

引用

@article{arxiv.2602.03425,
  title  = {ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning},
  author = {Xiaofeng Tan and Jun Liu and Yuanting Fan and Bin-Bin Gao and Xi Jiang and Xiaochen Chen and Jinlong Peng and Chengjie Wang and Hongsong Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2602.03425},
  year   = {2026}
}