中文

OV-COAST:基于最优传输的代价聚合用于开放词汇语义分割

计算机视觉与模式识别 2025-06-05 v1

摘要

开放词汇语义分割(OVSS)涉及使用文本描述为图像中的每个像素分配语义标签,通常借助 CLIP 等世界模型。为增强跨域泛化能力,我们提出基于最优传输的代价聚合方法(OV-COAST)用于开放词汇语义分割。为在最优传输理论框架内对齐视觉-语言特征,我们采用代价体构建代价矩阵,用于量化两个分布之间的距离。我们的方法采用两阶段优化策略:第一阶段,利用代价体通过 Sinkhorn 距离求解最优传输问题以获得对齐解;第二阶段,该解用于指导 CAT-Seg 模型的训练。我们在 MESS 基准上评估了最先进的 OVSS 模型,我们的方法显著提升了代价聚合模型 CAT-Seg(ViT-B 骨干网络)的性能,实现了优于 CAT-Seg 1.72% 和 SAN-B 4.9% mIoU 的优越结果。代码地址:https://github.com/adityagandhamal/OV-COAST/。

关键词

引用

@article{arxiv.2506.03706,
  title  = {OV-COAST: Cost Aggregation with Optimal Transport for Open-Vocabulary Semantic Segmentation},
  author = {Aditya Gandhamal and Aniruddh Sikdar and Suresh Sundaram},
  journal= {arXiv preprint arXiv:2506.03706},
  year   = {2025}
}

备注

Accepted at CVPR 2025 Workshop on Transformers for Vision (Non-archival track)