从扩散模型到整流流:重新思考基于文本的分割
计算机视觉与模式识别
2026-05-07 v1 人工智能
摘要
基于文本的图像分割旨在根据文本提示描绘图像中的目标边界,与传统的固定类别分割任务相比,提供了更高的灵活性和更广泛的应用范围。近期研究表明,扩散模型(如 Stable Diffusion)能够提供丰富的多模态语义特征,从而引发了将扩散模型用作分割任务特征提取器的研究。然而,此类方法继承了扩散模型的生成特性,这对判别性分割任务是有害的。为此,我们提出 RLFSeg,一种利用整流流在潜在空间中学习从图像到分割掩码直接映射的新框架。该模型因此摆脱了噪声-去噪过程以及优化扩散模型时间步的需求,在零样本场景下取得了显著优于以往基于扩散方法的性能。通过引入标签细化和自适应单步采样策略,该模型即使在单次推理步骤下也能实现更高的精度。该框架在模型结构零修改的情况下将预训练生成模型重定向至判别性分割任务,从而展现出广阔的应用潜力和重要的研究价值。
引用
@article{arxiv.2605.04590,
title = {From Diffusion to Rectified Flow: Rethinking Text-Based Segmentation},
author = {Zishen Qu and Xuesong Li and Haijian Gu and Hongwei Kang and Quan Meng and Tianrui Niu and Xin Yang and Ruidong Pan},
journal= {arXiv preprint arXiv:2605.04590},
year = {2026}
}
备注
Accepted at ICMR 2026