中文

基于离线扩散增强原型生成的免训练开放词汇分割

计算机视觉与模式识别 2024-04-11 v1

摘要

开放词汇语义分割旨在对以文本形式表达的任意类别进行分割。以往的工作通过在大量图像-标题对上进行训练,以强化像素级多模态对齐。然而,标题提供了关于给定图像语义的全局信息,但缺乏对单个概念的直接定位。此外,在大规模数据集上进行训练不可避免地带来巨大的计算成本。本文中,我们提出了 FreeDA,一种用于开放词汇语义分割的免训练扩散增强方法,该方法利用扩散模型在视觉上定位生成概念的能力,并利用局部-全局相似性将类无关区域与语义类别进行匹配。我们的方法包含一个离线阶段,从大量标题出发,利用视觉和语义上下文收集文本-视觉参考嵌入。在测试时,查询这些嵌入以支持视觉匹配过程,该过程通过联合考虑类无关区域和全局语义相似性来执行。广泛的分析表明,FreeDA 在五个数据集上取得了 SOTA 性能,在 mIoU 上比以往方法平均超出 7.0 个点以上,且无需任何训练。

关键词

引用

@article{arxiv.2404.06542,
  title  = {Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation},
  author = {Luca Barsellotti and Roberto Amoroso and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2404.06542},
  year   = {2024}
}

备注

CVPR 2024. Project page: https://aimagelab.github.io/freeda/