PerLA:感知式 3D 语言助手
计算机视觉与模式识别
2025-04-08 v2 计算与语言
机器学习
摘要
使大语言模型(LLM)理解 3D 物理世界是当前尚具挑战的研究方向。当前处理点云的策略通常通过下采样场景或将其划分为更小的部分进行单独分析。然而,这两种方法都风险丧失关键局部细节或全局上下文信息。本文提出 PerLA,一种为 LLM 设计的 3D 语言助手,能够对细节和上下文更敏感,从而使视觉表征更具信息量。PerLA 从不同点云区域并行捕获高分辨率(局部)细节,并将其与来自低分辨率整个点云的(全局)上下文相集成。我们提出了一种通过 Hilbert 曲线保持点云局部性、并通过跨注意力和图神经网络实现局部到全局信息聚合的新型算法。最后,我们引入一种新的损失以促进局部表示一致性。PerLA 在 ScanQA 上实现了最新 3D 语言助手的优势,问答任务上 CiDEr 提升最高可达 +1.34,在 ScanRefer 和 Nr3D 的密集描述任务上分别提升 +4.22 和 +3.88。https://gfmei.github.io/PerLA/
引用
@article{arxiv.2411.19774,
title = {PerLA: Perceptive 3D Language Assistant},
author = {Guofeng Mei and Wei Lin and Luigi Riz and Yujiao Wu and Fabio Poiesi and Yiming Wang},
journal= {arXiv preprint arXiv:2411.19774},
year = {2025}
}
备注
Accepted by CVPR2025