Stable-Layers:使用 VLM 评分的强化学习微调图像层分解模型
计算机视觉与模式识别
2026-05-29 v1
摘要
我们提出了 Stable-Layers,一个强化学习框架,用于仅通过来自视觉语言模型 (VLM) 的反馈来微调预训练的层分解模型。我们以 Qwen-Image-Layered 为起点,应用 Flow-GRPO 并采用 LoRA 适配,针对每张图像采样多个候选分解方案,并由 VLM 对其进行评分,通过组相对优势来优化策略。关键挑战在于设计可靠的奖励信号:VLMs 在孤立状态下的评分倾向于将判断压缩到狭窄的区间,这导致 GRPO 几乎没有组内方差可供学习。我们通过两个阶段的评估管道来解决这一问题:该管道将结构化的逐样本评分与五个编辑导向准则相结合,并引入基于网格的校准步骤,其中 VLM 对所有候选方案进行并列评分。与基础模型相比,Stable-Layers 在 Crello 数据集上产生的分解具有更强的层间分离、更少的空白或含噪声的层,以及更低的逐层重构误差。
引用
@article{arxiv.2605.30257,
title = {Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning},
author = {Ciara Rowles and Reshinth Adithyan and Nikhil Pinnaparaju and Vikram Voleti and Mark Boss},
journal= {arXiv preprint arXiv:2605.30257},
year = {2026}
}
备注
25 pages, 8 figures, 4 tables. Project page: https://stability-ai.github.io/stable-layers.github.io/