OV-COAST:基于最优传输的代价聚合用于开放词汇语义分割
计算机视觉与模式识别
2025-06-05 v1
摘要
开放词汇语义分割(OVSS)涉及使用文本描述为图像中的每个像素分配语义标签,通常借助 CLIP 等世界模型。为增强跨域泛化能力,我们提出基于最优传输的代价聚合方法(OV-COAST)用于开放词汇语义分割。为在最优传输理论框架内对齐视觉-语言特征,我们采用代价体构建代价矩阵,用于量化两个分布之间的距离。我们的方法采用两阶段优化策略:第一阶段,利用代价体通过 Sinkhorn 距离求解最优传输问题以获得对齐解;第二阶段,该解用于指导 CAT-Seg 模型的训练。我们在 MESS 基准上评估了最先进的 OVSS 模型,我们的方法显著提升了代价聚合模型 CAT-Seg(ViT-B 骨干网络)的性能,实现了优于 CAT-Seg 1.72% 和 SAN-B 4.9% mIoU 的优越结果。代码地址:https://github.com/adityagandhamal/OV-COAST/。
引用
@article{arxiv.2506.03706,
title = {OV-COAST: Cost Aggregation with Optimal Transport for Open-Vocabulary Semantic Segmentation},
author = {Aditya Gandhamal and Aniruddh Sikdar and Suresh Sundaram},
journal= {arXiv preprint arXiv:2506.03706},
year = {2025}
}
备注
Accepted at CVPR 2025 Workshop on Transformers for Vision (Non-archival track)