LawDIS:基于语言-窗口的可控二分图像分割
计算机视觉与模式识别
2025-08-05 v1
摘要
我们提出LawDIS,一个语言-窗口驱动的可控二分图像分割(DIS)框架,生成高质量对象掩码。我们的框架将DIS重构为基于图像的掩码生成任务 within latent diffusion model,实现用户控制的无缝集成。LawDIS通过宏观到微观控制模式得到增强。具体而言,在宏观模式下,我们引入语言控制分割策略(LS),基于用户提供的语言提示生成初始掩码。在微观模式下,窗口控制精炼策略(WR)允许灵活地在初始掩码内的用户定义区域(即可调整大小的窗口)内进行精炼。由模式切换器协调,这些模式可独立或联合运行,使该框架适用于高精度、个性化应用。广泛实验表明,LawDIS在DIS5K基准上显著优于11个最先进方法。值得注意的是,与第二名模型MVANet相比,在LS和WR策略下F_beta^omega提升4.6%,仅使用LS策略时提升3.6%。代码将在https://github.com/XinyuYanTJU/LawDIS公开。
引用
@article{arxiv.2508.01152,
title = {LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation},
author = {Xinyu Yan and Meijun Sun and Ge-Peng Ji and Fahad Shahbaz Khan and Salman Khan and Deng-Ping Fan},
journal= {arXiv preprint arXiv:2508.01152},
year = {2025}
}
备注
17 pages, 10 figures, ICCV 2025