Logic-RAG:为增强路面场景理解的大型多模态模型注入视觉-空间知识
计算机视觉与模式识别
2025-03-18 v1 计算与语言
机器学习
机器人学
摘要
大型多模态模型(LMM)越来越多地被集成到自动驾驶系统中用于用户交互。然而,其在细粒度空间推理方面的局限性为系统可解释性和用户信任带来了挑战。我们引入 Logic-RAG,一种新的检索增强生成(RAG)框架,用于提高 LMM 在驾驶场景中的空间理解能力。Logic-RAG 使用感知模块、查询到逻辑嵌入器和逻辑推理引擎构建关于对象-对象关系的一阶逻辑(FOL)的动态知识库。我们在使用合成和真实世界驾驶视频进行的视觉-空间查询评估中评估了 Logic-RAG。当使用流行的 LMM(GPT-4V、Claude 3.5)作为自动驾驶系统的代理时,这些模型在合成驾驶场景上的准确率仅为 55%,在真实世界驾驶场景上的准确率不足 75%。将 Logic-RAG 与其 augment 后,准确率分别提升至超过 80% 和 90%。消融研究表明,即使没有逻辑推理,Logic-RAG alone 构建的基于事实的上下文也能将准确率提高 15%。Logic-RAG 是可扩展的:它允许无缝替换各个组件以使用更好的版本,并使领域专家能够以 FOL 和自然语言组合新的知识。总之,Logic-RAG 解决了 LMM 在自动驾驶应用中进行空间推理的关键缺陷。代码和数据已在 https://github.com/Imran2205/LogicRAG 提供。
引用
@article{arxiv.2503.12663,
title = {Logic-RAG: Augmenting Large Multimodal Models with Visual-Spatial Knowledge for Road Scene Understanding},
author = {Imran Kabir and Md Alimoor Reza and Syed Billah},
journal= {arXiv preprint arXiv:2503.12663},
year = {2025}
}