中文

ReSemAct:通过语义结构化与功能细化以提升细粒度机器人操作

机器人学 2025-12-30 v4 人工智能 计算机视觉与模式识别 人机交互 机器学习

摘要

细粒度机器人操作需要将自然语言 grounded 到合适的功能目标上。然而,大多数基于基础模型的方法会将丰富的语义压缩为过于简化的功能,从而无法利用隐含的语义信息。为此,我们提出ReSemAct,一个新型统一的操作框架,引入语义结构化与功能细化(SSAR),并由多模态大语言模型(MLLMs)与视觉基础模型(VFMs)的自动协同推理驱动。具体而言,语义结构化模块从自然语言和RGB观测中导出统一的语义功能描述,将功能区域、隐含的功能意图和粗略的功能锚点组织为结构化表示,以供后续细化。基于此规范,功能细化策略分别实现几何与位置两个互补的流,分别专精于几何与位置,从而得到细粒度的功能目标。这些被细化的目标随后被编码为实时的关节空间优化目标,实现在动态环境中的响应式且稳健的操作。在语义丰富的家庭环境和稀疏化学实验室环境中进行了大量仿真和实际实验。结果表明,ReSemAct能够在零样本条件下完成多样化任务,展示了SSAR在细粒度操作中利用基础模型的鲁棒性。代码与视频请参见 https://github.com/scy-v/ReSemAct 和 https://resemact.github.io。

关键词

引用

@article{arxiv.2507.18262,
  title  = {ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement},
  author = {Chenyu Su and Weiwei Shang and Chen Qian and Fei Zhang and Shuang Cong},
  journal= {arXiv preprint arXiv:2507.18262},
  year   = {2025}
}

备注

Code and videos: https://github.com/scy-v/ReSemAct and https://resemact.github.io