REALM: 用于高斯点云开放世界 3D 推理分割与编辑的 MLLM-Agent 框架
计算机视觉与模式识别
2026-03-12 v3
摘要
在视觉与机器人学领域, 将复杂的人类指令与精确的 3D 物体定位之间仍存在显著鸿沟。现有的 3D 分割方法往往难以解释模糊且基于推理的指令, 而擅长此类推理的 2D 视觉语言模型缺乏内在的 3D 空间理解能力。为此, 本文引入 REALM, 一个创新的 MLLM-Agent 框架, 实现无需大量 3D 特定后训练即可进行开放世界推理基准分割。我们直接在 3D 高斯点云表示上进行分割, 充分利用其能够渲染出高保真新视角的能力, 这非常适合 MLLM 的理解。由于直接将一个或多个渲染视角输入 MLLM 可能对视角选择高度敏感, 我们提出了一种全到局部分布 grounding 策略: 首先将多个全局视角并行输入 MLLM Agent 进行粗糙定位, 聚合响应以可靠识别目标物体。随后, 生成数个目标物体的近距离新视角, 执行细粒度局部分割, 生成准确且一致的 3D 掩码。广泛实验表明, REALM 在 LERF、3D-OVS 及我们新构建的 REALM3D 数据集上, 在解释显式与隐式指令方面取得卓越性能。此外, 本框架无缝支持包括物体删除、替换与风格迁移等多种 3D 交互任务, 展示了其实际用途与多样性。项目页面: https://ChangyueShi.github.io/REALM.
引用
@article{arxiv.2510.16410,
title = {REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting},
author = {Changyue Shi and Minghao Chen and Yiping Mao and Chuxiao Yang and Xinyuan Hu and Jiajun Ding and Zhou Yu},
journal= {arXiv preprint arXiv:2510.16410},
year = {2026}
}
备注
CVPR 2026 Accepted