神经特征融合场:自监督 2D 图像表征的 3D 蒸馏
计算机视觉与模式识别
2022-09-09 v1 图形学
摘要
我们提出神经特征融合场(N3F),这是一种在可重建为 3D 场景的多幅图像分析中改进稠密 2D 图像特征提取器的方法。给定一个图像特征提取器,例如使用自监督预训练的提取器,N3F 将其作为教师来学习定义在 3D 空间中的学生网络。该 3D 学生网络类似于神经辐射场,可蒸馏上述特征,并可使用常规的可微渲染机制进行训练。因此,N3F 易于应用于大多数神经渲染公式,包括 vanilla NeRF 及其对复杂动态场景的扩展。我们表明,我们的方法不仅能在无需人工标注的情况下实现特定场景神经场中的语义理解,而且始终优于自监督 2D 基线。这可以通过在多种序列(包括 EPIC-KITCHENS 基准中的长第一视角视频)上考虑各种任务(如 2D 物体检索、3D 分割和场景编辑)来证明。
引用
@article{arxiv.2209.03494,
title = {Neural Feature Fusion Fields: 3D Distillation of Self-Supervised 2D Image Representations},
author = {Vadim Tschernezki and Iro Laina and Diane Larlus and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2209.03494},
year = {2022}
}
备注
3DV2022, Oral. Project page: https://www.robots.ox.ac.uk/~vadim/n3f/