FA-Seg:基于扩散模型的快速精准开放词汇分割方法
计算机视觉与模式识别
2026-04-30 v6
摘要
开放词汇语义分割(OVSS)旨在无需密集标注数据,对任意文本类别进行对象分割。尽管基于对比学习的模型实现了零样本分割,但常因全局表示偏差而丢失像素级的细粒度空间精度。相比之下,扩散模型通过注意力机制自然编码细粒度空间特征,同时捕获全局语境和局部细节。然而,扩散模型常面临计算成本与分割掩码质量之间的平衡挑战。本文提出FA-Seg,一个基于扩散模型的快速精准训练-free开放词汇分割框架。FA-Seg仅使用一个(1+1)步即可完成分割。此外,FA-Seg无需针对不同类别多次运行,即可一次性完成所有类别的分割。为进一步提升分割质量,FA-Seg引入了三个关键组件:(i) 双提示机制,用于从判别性、类别感知的注意力中提取特征;(ii) 分层注意力细化方法(HARD),通过多分辨率注意力融合增强语义精度;(iii) 测试时翻转(TTF)方案,用于提高空间一致性。大量实验表明,FA-Seg实现了在PASCAL VOC、PASCAL Context和COCO Object基准数据集上43.8%的平均mIoU,实现了最先进的训练-free性能,同时保持卓越的推理效率。我们的结果表明,FA-Seg为分割质量与推理效率之间的可扩展性提供了有力基础。源码已公开于 https://github.com/chequanghuy/FA-Seg。
引用
@article{arxiv.2506.23323,
title = {FA-Seg: A Fast and Accurate Diffusion-Based Method for Open-Vocabulary Segmentation},
author = {Huy Che and Vinh-Tiep Nguyen},
journal= {arXiv preprint arXiv:2506.23323},
year = {2026}
}