将 LLM 先验蒸馏至流模型,以实现目标智能体在目标物体导航中的可泛化想象
计算机视觉与模式识别
2025-10-22 v2 机器人学
摘要
目标物体导航 (ObjectNav) 任务挑战智能体在未见环境中通过想象未观测区域来定位指定目标物体。先前方法依赖确定性判别模型完成语义地图,忽视室内布局内在不确定性,限制了其对未见环境的泛化能力。本文提出 GOAL,一种基于生成式流模型的框架,通过桥接观测区域与 LLM 丰富的全场景语义地图,建模室内环境的语义分布。在训练期间,空间先验从大型语言模型 (LLM) 推断为二维高斯场并注入目标地图中,从而将丰富的上下文知识蒸馏至流模型中,实现更具泛化性的完成。大量实验表明,GOAL 在 MP3D 和 Gibson 上实现了最佳性能,并在转移到 HM3D 的情况下表现出强大的泛化能力。代码和预训练模型已提供:https://github.com/Badi-Li/GOAL。
引用
@article{arxiv.2508.09423,
title = {Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation},
author = {Badi Li and Ren-jie Lu and Yu Zhou and Jingke Meng and Wei-shi Zheng},
journal= {arXiv preprint arXiv:2508.09423},
year = {2025}
}