A3R:基于3D高斯场景中跨维度证据的代理式可获取性推理
计算机视觉与模式识别
2026-04-03 v1
摘要
3D 高斯场景中的可获取性推理旨在识别在复杂环境中支持给定文本指令所指定动作的区域。现有方法通常将此问题视为从静态场景观察中进行单次预测,假设已存在足够的证据用于推理。然而,在复杂的3D场景中,许多失败案例并非源于弱的预测能力,而是源于在固定观察下的任务相关证据不完整。为此,我们将细粒度可获取性推理重新表述为逐步获取互补3D几何和2D语义证据以逐步减少歧义的过程。基于此表述,我们提出 A3R—an 基于 MLLM 策略的代理式可获取性推理框架,后者可迭代选择证据获取动作并通过跨维度证据获取更新可获取性信念。为优化这种顺序决策,我们进一步引入基于 GRPO 的策略学习策略,以提高证据获取效率和推理准确性。大量实验表明,A3R 在场景级基准上 consistently 超过了静态单次基线,展示了代理式跨维度证据获取在复杂3D 高斯场景中进行细粒度可获取性推理方面的优势。
引用
@article{arxiv.2604.01882,
title = {A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes},
author = {Di Li and Jie Feng and Guanbin Li and Ronghua Shang and Yuhui Zheng and Weisheng Dong and Guangming Shi},
journal= {arXiv preprint arXiv:2604.01882},
year = {2026}
}