渲染器是优秀的零样本表示学习器:探索扩散隐空间用于度量学习
计算机视觉与模式识别
2023-06-21 v1
摘要
现代生成式神经渲染模型的隐空间能否作为面向 3D 感知判别性视觉理解任务的表示?我们使用检索作为衡量 Shap-E 隐空间度量学习特性的代理,包括捕捉视角无关性以及从单图像视角的表示聚合场景表示,发现 Shap-E 表示在零样本下优于经典 EfficientNet 基线表示,且在两种方法均使用对比损失训练时仍具竞争力。这些发现初步表明,基于 3D 的渲染与生成模型可为我们天然 3D 本征世界中的判别任务提供有用表示。我们的代码见 \url{https://github.com/michaelwilliamtang/golden-retriever}。
引用
@article{arxiv.2306.10721,
title = {Renderers are Good Zero-Shot Representation Learners: Exploring Diffusion Latents for Metric Learning},
author = {Michael Tang and David Shustin},
journal= {arXiv preprint arXiv:2306.10721},
year = {2023}
}