Dynamic-TreeRPO:通过结构化抽样打破独立轨迹瓶颈
摘要
将强化学习 (Reinforcement Learning, RL) 集成到文本到图像 (Text-to-Image, T2I) 生成的流匹配模型中,推动了生成质量的显著提升。然而,这些收益往往以耗尽的探索和低效的抽样策略为代价,由于抽样组之间的细微差异导致策略不够高效。基于这一洞察,我们提出 Dynamic-TreeRPO,通过树结构的搜索在深度上实现动态噪声强度的滑动窗口抽样策略。我们在该树结构中执行 GRPO 指导的优化和受约束的随机微分方程 (Stochastic Differential Equation, SDE) 抽样。通过共享树的前缀路径,我们的设计有效地 amortizes 了轨迹搜索的计算开销。通过为每个树层设计良好的噪声强度,Dynamic-TreeRPO 能够在不增加额外计算成本的情况下增强探索变体性。此外,我们无缝地将监督微调 (Supervised Fine-Tuning, SFT) 和 RL 范式整合到 Dynamic-TreeRPO 中,以构建我们提出的 LayerTuning-RL 方法,将 SFT 的损失函数重新表述为动态加权的进度奖励模型 (Progress Reward Model, PRM),而非独立的预训练方法。通过将该加权 PRM 与动态自适应裁剪边界关联,避免了 Dynamic-TreeRPO 中探索过程的干扰。得益于树结构抽样和 LayerTuning-RL 范式,our model 在有效方向上动态地探索多样化的搜索空间。与现有基线相比,我们的方法在语义一致性、视觉保真度和人类偏好对齐方面均表现出显著优势,包括 HPS-v2.1、PickScore 和 ImageReward 等已建立的基准测试。特别是,我们的模型在这些基准测试中分别超过 SoTA 4.9%、5.91% 和 8.66%,同时将训练效率提高了近 50%。
引用
@article{arxiv.2509.23352,
title = {Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling},
author = {Xiaolong Fu and Lichen Ma and Zipeng Guo and ShiPing Dong and Lan Yang and Tan Lit Sin and Gaojing Zhou and Yu He and Jingling Fu and Shizhe Zhou and Junshi Huang and Jason Li},
journal= {arXiv preprint arXiv:2509.23352},
year = {2026}
}
备注
Fig.3 updated