神经凝聚:将图像对齐到联合语义图集
计算机视觉与模式识别
2023-03-07 v2
摘要
我们提出 Neural Congealing——一种零样本自监督框架,用于检测给定图像集中语义共性内容并对其进行联合对齐。我们的方法利用预训练的 DINO-ViT 特征来学习:(i) 联合语义图集——一个捕捉输入集中 DINO-ViT 特征模式的 2D 网格,以及 (ii) 从统一图集到各输入图像的稠密映射。我们推导出一个新的鲁棒自监督框架,针对每个图像集优化图集表示与映射,仅需要少量真实世界图像作为输入,无需任何额外输入信息(如分割掩码)。值得注意的是,我们设计的损失与训练范式仅考虑在外观、姿态、背景杂乱或其他干扰物体严重变化下的共享内容。我们在大量具有挑战性的图像集上展示了结果,包括混合域集合(如对齐描绘猫的雕塑与艺术品的图像)、描绘相关但不同对象类别的集合(如狗与虎),以及大规模训练数据稀缺的域(如咖啡杯)。我们对该方法进行了充分评估,表明我们的测试时优化方法相比需要在大规模数据集上广泛训练的先进方法表现更优。
引用
@article{arxiv.2302.03956,
title = {Neural Congealing: Aligning Images to a Joint Semantic Atlas},
author = {Dolev Ofri-Amar and Michal Geyer and Yoni Kasten and Tali Dekel},
journal= {arXiv preprint arXiv:2302.03956},
year = {2023}
}
备注
Project page: https://neural-congealing.github.io/