中文

AssemMate:基于图的机器人装配协助大语言模型

机器人学 2026-03-03 v2

摘要

基于大语言模型(Large Language Model, LLM)的机器人装配协助正在获得广泛关注。它需要注入领域特定知识,通过与人类进行自然语言交互来引导装配过程。尽管已有一些进展,但现有方法将知识表示为自然语言文本形式。由于上下文长度长且内容冗余,这些方法难以满足机器人对实时和精确推理的要求。为弥合这一差距,本文提出了 AssemMate,利用图——一种简洁且准确的知识表示形式——作为输入。这种基于图的 LLM 启用了知识图问(knowledge graph question answering, KGQA),支持针对特定产品的人机交互和装配任务规划。除了交互式问答,AssemMate 还支持感知堆叠场景并执行抓取以协助装配。具体而言,一个自监督的图卷积网络(Graph Convolutional Network, GCN)将知识图中的实体和关系编码到潜在空间,并与 LLM 的表示对齐,使 LLM 能够理解图信息。此外,采用一种视觉增强策略来解决堆叠场景中的抓取问题。通过训练和评估,AssemMate 在性能上优于现有方法,检测准确率提高6.4%,推理速度提升3倍,上下文长度缩短28倍,并在随机图上表现出强大的泛化能力。我们的 approach 还通过仿真和真实世界的机器人抓取实验表现出优越性。更多细节可在项目页面 https://github.com/cristina304/AssemMate.git 查阅。

关键词

引用

@article{arxiv.2509.11617,
  title  = {AssemMate: Graph-Based LLM for Robotic Assembly Assistance},
  author = {Qi Zheng and Chaoran Zhang and Zijian Liang and EnTe Lin and Shubo Cui and Qinghongbing Xie and Zhaobo Xu and Long Zeng},
  journal= {arXiv preprint arXiv:2509.11617},
  year   = {2026}
}