中文

渲染器是优秀的零样本表示学习器:探索扩散隐空间用于度量学习

计算机视觉与模式识别 2023-06-21 v1

摘要

现代生成式神经渲染模型的隐空间能否作为面向 3D 感知判别性视觉理解任务的表示?我们使用检索作为衡量 Shap-E 隐空间度量学习特性的代理,包括捕捉视角无关性以及从单图像视角的表示聚合场景表示,发现 Shap-E 表示在零样本下优于经典 EfficientNet 基线表示,且在两种方法均使用对比损失训练时仍具竞争力。这些发现初步表明,基于 3D 的渲染与生成模型可为我们天然 3D 本征世界中的判别任务提供有用表示。我们的代码见 \url{https://github.com/michaelwilliamtang/golden-retriever}。

关键词

引用

@article{arxiv.2306.10721,
  title  = {Renderers are Good Zero-Shot Representation Learners: Exploring Diffusion Latents for Metric Learning},
  author = {Michael Tang and David Shustin},
  journal= {arXiv preprint arXiv:2306.10721},
  year   = {2023}
}