扩放 LLaNA:通过大规模训练推进 NeRF-语言理解
计算机视觉与模式识别
2025-04-22 v1
摘要
最近的多模态大语言模型(MLLM)在理解图像和3D数据方面展现出惊人的能力,但这些模态在全面代表物体几何和外观方面存在固有局限。神经辐射场(NeRF)作为一种有前景的替代方案,将几何和照片级属性编码于简单的多层感知器(MLP)的权重中。本工作调查将NeRF纳入MLLM的可行性和有效性。我们引入LLaNA,这是首个能够执行诸如NeRF描述和问答等新任务的MLLM,直接处理NeRF MLP的权重。值得注意的是,LLaNA能够在无需渲染图像或实例化3D数据结构的情况下提取所表示物体的信息。此外,我们构建了首个大规模NeRF语言数据集,由超过30万个在ShapeNet和Objaverse上训练的NeRF组成,配有配对文本注释,支持各种NeRF语言任务。基于该数据集,我们开发了评估LLaNA方法在NeRF理解方面能力的基准。结果表明,直接处理NeRF权重在NeRF语言任务上性能优于依赖2D或3D表示(由NeRF派生)的方法。
引用
@article{arxiv.2504.13995,
title = {Scaling LLaNA: Advancing NeRF-Language Understanding Through Large-Scale Training},
author = {Andrea Amaduzzi and Pierluigi Zama Ramirez and Giuseppe Lisanti and Samuele Salti and Luigi Di Stefano},
journal= {arXiv preprint arXiv:2504.13995},
year = {2025}
}
备注
Under submission. Project page at https://andreamaduzzi.github.io/llana/