PolyFormer:将指代图像分割视为序列多边形生成
计算机视觉与模式识别
2023-03-29 v2
摘要
在本工作中,我们不直接预测像素级分割掩码,而是将指代图像分割问题表述为序列多边形生成,所预测的多边形可随后转换为分割掩码。这由一个新提出的序列到序列框架 Polygon Transformer(PolyFormer)实现,其以图像块序列与文本查询词元为输入,并以自回归方式输出多边形顶点序列。为获得更精确的几何定位,我们提出基于回归的解码器,直接预测精确的浮点坐标,而不产生任何坐标量化误差。实验中,PolyFormer 以明显优势超越先前最优方法,例如在具有挑战性的 RefCOCO+ 与 RefCOCOg 数据集上分别取得 5.40% 与 4.52% 的绝对提升。在不微调的情况下评估指代视频分割任务时,它也展现出强泛化能力,例如在 Ref-DAVIS17 数据集上取得具竞争力的 61.5% J&F。
引用
@article{arxiv.2302.07387,
title = {PolyFormer: Referring Image Segmentation as Sequential Polygon Generation},
author = {Jiang Liu and Hui Ding and Zhaowei Cai and Yuting Zhang and Ravi Kumar Satzoda and Vijay Mahadevan and R. Manmatha},
journal= {arXiv preprint arXiv:2302.07387},
year = {2023}
}
备注
CVPR 2023. Project Page: https://polyformer.github.io/