扩散即推理:通过基于大语言模型物体-房间知识的扩散模型增强物体导航
计算机视觉与模式识别
2025-06-10 v2 人工智能
摘要
物体导航(ObjectNav)任务旨在引导智能体利用部分观测在未见环境中定位目标物体。先前的方法采用位置预测范式来实现长期目标推理,但这些方法往往难以有效整合上下文关系推理。或者,基于地图补全的范式通过生成未探索区域的语义地图来预测长期目标。然而,此类现有方法未能充分利用已知环境信息,导致地图质量次优,需要进一步改进。在这项工作中,我们提出了一种增强 ObjectNav 任务的新方法,通过训练扩散模型学习语义地图中物体的统计分布模式,并利用导航过程中已探索区域的地图作为条件,生成未知区域的地图,从而实现目标物体的长期目标推理,即扩散即推理(DAR)。同时,我们提出了房间引导方法,该方法利用从大语言模型(LLMs)中获取的常识知识,引导扩散模型生成具有房间感知的物体分布。基于生成的未知区域地图,智能体将目标的预测位置设为目的地并朝其移动。在 Gibson 和 MP3D 上的实验证明了我们方法的有效性。
引用
@article{arxiv.2410.21842,
title = {Diffusion as Reasoning: Enhancing Object Navigation via Diffusion Model Conditioned on LLM-based Object-Room Knowledge},
author = {Yiming Ji and Kaijie Yun and Yang Liu and Zhengpu Wang and Boyu Ma and Zongwu Xie and Hong Liu},
journal= {arXiv preprint arXiv:2410.21842},
year = {2025}
}