fVDB:面向稀疏、大规模与高性能三维空间智能的深度学习框架
计算机视觉与模式识别
2025-09-30 v2 图形学
机器学习
摘要
我们提出 fVDB,这是一个针对大规模三维数据的 GPU 优化深度学习框架。fVDB 提供了构建用于三维学习中常见任务(如卷积、池化、注意力、光线追踪、网格化等)的深度学习架构的完整可微原语集合。fVDB 同时提供的原语和算子数量远超既有框架,且在不牺牲效率的前提下发挥优势:我们的算子性能可匹配或超越其他框架中功能更窄的实现。此外,fVDB 能够处理比以前工作更大规模的数据集和更高的空间分辨率,同时在小规模输入上保持竞争的内存占用。为实现这种灵活性与性能的结合,fVDB 依赖于一种新颖的 VDB 索引网格加速结构,以及若干关键创新,包括 GPU 加速的稀疏网格构建、基于张量核心的卷积、使用层次化数字微分分析器 (HDDA) 算法实现的快速光线追踪内核,以及 jagged 张量。我们的框架完全集成于 PyTorch,实现与现有流程的互操作性,我们在诸多典型任务上展示了其有效性,包括大规模点云分割、高分辨率三维生成建模、无界尺度神经辐射场以及大规模点云重建。
引用
@article{arxiv.2407.01781,
title = {fVDB: A Deep-Learning Framework for Sparse, Large-Scale, and High-Performance Spatial Intelligence},
author = {Francis Williams and Jiahui Huang and Jonathan Swartz and Gergely Klár and Vijay Thakkar and Matthew Cong and Xuanchi Ren and Ruilong Li and Clement Fuji-Tsang and Sanja Fidler and Eftychios Sifakis and Ken Museth},
journal= {arXiv preprint arXiv:2407.01781},
year = {2025}
}