语言驱动的语义分割
计算机视觉与模式识别
2022-04-05 v2 计算与语言
机器学习
摘要
我们提出 LSeg,一种用于语言驱动语义图像分割的新模型。LSeg 使用文本编码器计算描述性输入标签(如“草”或“建筑”)的嵌入,以及基于 transformer 的图像编码器计算输入图像的密集逐像素嵌入。图像编码器以对比目标进行训练,以使像素嵌入与对应语义类别的文本嵌入对齐。文本嵌入提供了一种灵活的标签表示,其中语义相似的标签映射到嵌入空间中的相似区域(如“猫”和“毛茸茸的”)。这使得 LSeg 在测试时能够泛化到先前未见的类别,无需重新训练甚至不需要一个额外的训练样本。我们证明,与现有的零样本和少样本语义分割方法相比,我们的方法实现了极具竞争力的零样本性能,并且在提供固定标签集时甚至匹配传统分割算法的精度。代码和演示可在 https://github.com/isl-org/lang-seg 获取。
引用
@article{arxiv.2201.03546,
title = {Language-driven Semantic Segmentation},
author = {Boyi Li and Kilian Q. Weinberger and Serge Belongie and Vladlen Koltun and René Ranftl},
journal= {arXiv preprint arXiv:2201.03546},
year = {2022}
}
备注
ICLR 2022