微调但零样本的三维形状草图视图相似度与检索
计算机视觉与模式识别
2023-07-28 v2 人工智能
摘要
近来,诸如 ViT(视觉 transformer)和 ResNet 等编码器已在海量数据集上训练,并用作比较草图与图像的感知度量,以及零样本设置下的多域编码器。然而,量化这些编码器粒度的努力有限。我们的工作通过关注单个三维实例的多模态二维投影来解决这一空白。该任务对检索和基于草图的建模具有关键意义。我们表明,在零样本设置下,草图越抽象,错误图像匹配的可能性越高。即使在同一草图域内,由不同个体绘制的同一对象的不同风格草图也可能无法准确匹配。我们研究的一个关键发现是,对一类三维形状进行精细微调可提升其他形状类的性能,达到或超过监督方法的精度。我们比较并讨论了几种微调策略。此外,我们深入探究了草图中物体尺度如何影响不同网络层特征的相似度,帮助我们确定哪些网络层提供最准确匹配。显著地,我们发现 ViT 和 ResNet 在处理相似物体尺度时表现最佳。我们相信我们的工作将对草图领域的研究产生重要影响,就如何采用大型预训练模型作为感知损失提供见解与指导。
引用
@article{arxiv.2306.08541,
title = {Fine-Tuned but Zero-Shot 3D Shape Sketch View Similarity and Retrieval},
author = {Gianluca Berardi and Yulia Gryaditskaya},
journal= {arXiv preprint arXiv:2306.08541},
year = {2023}
}