Uni-Synergy:通过协作强化学习桥接个性化理解与生成
计算机视觉与模式识别
2026-05-12 v1
摘要
统一多模态模型(UMMs)在通用任务中表现优异,但在个性化理解与生成之间的鸿沟仍显著。现有工作大多依赖通过监督微调实现的隐式token级对齐,无法充分捕捉理解与创造之间潜在的协同效应。本文提出Sync-R1,一个端到端的强化学习框架,能够在单一的显式推理循环中联合优化个性化理解与生成。通过这一统一的反馈过程,Sync-R1实现了个性化理解引导内容生成,同时生成质量的提升也能在集成的奖励景观中反向优化理解。为高效协调这一双任务协同,本文引入Sync-GRPO,一种利用ensemble奖励系统的强化学习方法。此外,本文提出动态分组缩放(DGS),用于自适应过滤低潜力轨迹,以减少梯度方差并加速收敛。为更贴近现实场景的复杂性,本文构建UnifyBench++数据集,包含更稠密的文本描述和更丰富的用户上下文。实验结果表明,Sync-R1实现了最先进的性能,展现出卓越的跨任务推理能力和稳健的个性化能力,且无需复杂的cold-start流程。代码和UnifyBench++数据集将发布于:https://github.com/arctanxarc/UniCTokens。
引用
@article{arxiv.2605.10445,
title = {Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning},
author = {Zijun Shen and Sihan Yang and Ruichuan An and Ziyu Guo and Hao Liang and Ming Lu and Renrui Zhang and Wentao Zhang},
journal= {arXiv preprint arXiv:2605.10445},
year = {2026}
}