中文

面向目标的轨迹信用分配:用于视觉生成的目标感知过程优化

计算机视觉与模式识别 2026-04-28 v2

摘要

强化学习,特别是Group Relative Policy Optimization (GRPO),已被证明是用于带有人类偏好信号的视觉生成模型后训练的有效框架,但其有效性受限于粗糙的奖励信用分配。在现代视觉生成中,常常使用多个奖励模型来捕获视觉质量、运动一致性和文本对齐等异构目标。现有的GRPO管道通常将这些奖励折叠为单个静态标量,并在整个扩散轨迹上均匀传递。这一设计忽略了不同去噪步骤的阶段性作用,产生错误时机或不兼容的优化信号。为此,我们提出一种称为目标感知轨迹信用分配(OTCA)的结构化框架,用于细粒度GRPO训练。OTCA包含两个关键组件。轨迹级信用分解估计不同去噪步骤的相对重要性。多目标信用分配在去噪过程中自适应地加权和组合多个奖励信号。通过联合建模时间信用和目标级别信用,OTCA将粗糙的奖励监督转化为与扩散生成的迭代性质相匹配的结构化、时步感知的训练信号。广泛的实验表明,OTCA在多个评估指标上均显著改善了图像和视频生成质量。

关键词

引用

@article{arxiv.2604.19234,
  title  = {Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation},
  author = {Rui Li and Ke Hao and Yuanzhi Liang and Haibin Huang and Chi Zhang and Yun Gu and XueLong Li},
  journal= {arXiv preprint arXiv:2604.19234},
  year   = {2026}
}