面向具身 AI 的场景驱动多模态知识图谱构建
人工智能
2024-05-14 v2 机器人学
符号计算
摘要
具身 AI 是人工智能与机器人领域最受关注的研究之一,可有效提升服务人类的真实世界智能体(即机器人)的智能化水平。场景知识对智能体理解周围环境并在多变的开放世界中做出正确决策十分重要。当前,面向具身任务的知识库缺失,且多数现有工作使用通用知识库或预训练模型来增强智能体的智能。对于传统知识库,其稀疏、容量不足且数据采集成本高;对于预训练模型,它们面临知识不确定性与维护困难。为克服场景知识的挑战,我们提出一种结合传统知识工程与大语言模型的场景驱动多模态知识图谱(Scene-MMKG)构建方法。我们引入统一的场景知识注入框架用于知识表示。为评估所提方法的优势,我们针对典型室内机器人功能(操作与移动)实例化 Scene-MMKG,命名为 ManipMob-MMKG。特性对比表明,我们实例化的 ManipMob-MMKG 在数据采集效率与知识质量上具有广泛优越性。在典型具身任务上的实验结果显示,使用我们实例化的 ManipMob-MMKG 的知识增强方法可在无需复杂重设计模型结构的情况下明显提升性能。我们的项目见 https://sites.google.com/view/manipmob-mmkg。
引用
@article{arxiv.2311.03783,
title = {Scene-Driven Multimodal Knowledge Graph Construction for Embodied AI},
author = {Song Yaoxian and Sun Penglei and Liu Haoyu and Li Zhixu and Song Wei and Xiao Yanghua and Zhou Xiaofang},
journal= {arXiv preprint arXiv:2311.03783},
year = {2024}
}
备注
14 pages, 6 figures