中文

Stable-Layers:使用 VLM 评分的强化学习微调图像层分解模型

计算机视觉与模式识别 2026-05-29 v1

摘要

我们提出了 Stable-Layers,一个强化学习框架,用于仅通过来自视觉语言模型 (VLM) 的反馈来微调预训练的层分解模型。我们以 Qwen-Image-Layered 为起点,应用 Flow-GRPO 并采用 LoRA 适配,针对每张图像采样多个候选分解方案,并由 VLM 对其进行评分,通过组相对优势来优化策略。关键挑战在于设计可靠的奖励信号:VLMs 在孤立状态下的评分倾向于将判断压缩到狭窄的区间,这导致 GRPO 几乎没有组内方差可供学习。我们通过两个阶段的评估管道来解决这一问题:该管道将结构化的逐样本评分与五个编辑导向准则相结合,并引入基于网格的校准步骤,其中 VLM 对所有候选方案进行并列评分。与基础模型相比,Stable-Layers 在 Crello 数据集上产生的分解具有更强的层间分离、更少的空白或含噪声的层,以及更低的逐层重构误差。

关键词

引用

@article{arxiv.2605.30257,
  title  = {Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning},
  author = {Ciara Rowles and Reshinth Adithyan and Nikhil Pinnaparaju and Vikram Voleti and Mark Boss},
  journal= {arXiv preprint arXiv:2605.30257},
  year   = {2026}
}

备注

25 pages, 8 figures, 4 tables. Project page: https://stability-ai.github.io/stable-layers.github.io/