通过双表示对齐的无监督部件发现
计算机视觉与模式识别
2024-08-16 v1
摘要
物体部件作为各种下游任务中的关键中间表示,但部件级表示学习尚未受到与其他视觉任务同等的关注。此前研究已表明Vision Transformer可以在无标签的情况下学习实例级注意力,为下游任务提取高质量的实例级表示。在本文中,我们利用一种新颖范式实现了无监督的部件特定注意力学习,并进一步利用部件表示来提升部件发现性能。具体而言,从同一图像通过不同几何变换生成配对图像,并使用一种名为PartFormer的新颖模块从这些配对图像中提取多个部件表示。这些配对图像的部件表示随后被交换以提升几何变换不变性。随后,部件表示与特征图编码器提取的特征图对齐,使其与相应部件区域的像素表示具有高相似度,与无关区域具有低相似度。最后,将几何和语义约束通过对齐中的中间结果应用于部件表示,以实现部件特定注意力学习,鼓励PartFormer局部聚焦,并使部件表示明确包含相应部件的信息。此外,对齐后的部件表示在测试阶段可进一步作为一系列可靠的检测器,预测部件发现的像素掩码。在四个广泛使用的数据集上进行了大量实验,结果表明所提方法由于其部件特定注意力而具有竞争性性能和鲁棒性。
引用
@article{arxiv.2408.08108,
title = {Unsupervised Part Discovery via Dual Representation Alignment},
author = {Jiahao Xia and Wenjian Huang and Min Xu and Jianguo Zhang and Haimin Zhang and Ziyu Sheng and Dong Xu},
journal= {arXiv preprint arXiv:2408.08108},
year = {2024}
}
备注
Accepted by TPAMI-2024