中文

微分与注入:通过参数内结构推理诱导的功能分化增强 VLA

机器人学 2026-02-10 v1

摘要

随着机器人被期望执行日益多样化的任务,它们不仅需要理解低级动作,还必须理解决定任务如何展开的高级结构。现有的视觉-语言-动作(VLA)模型难以应对这种形式的任务级推理。它们要么依赖于基于提示的上下文分解,这种方法不稳定且对语言变化敏感;要么依赖于端到端的长时域训练,这需要大规模演示并将任务级推理与低级控制纠缠在一起。我们提出了参数内结构化任务推理(iSTAR),这是一种通过参数内结构推理诱导的功能分化来增强 VLA 模型的框架。iSTAR 不是将 VLA 视为单一策略,而是将任务级语义结构直接嵌入模型参数中,从而无需外部规划器或手工制作的提示输入即可实现差异化的任务级推理。这种注入的结构采用隐式动态场景图知识的形式,在参数空间中捕获对象关系、子任务语义和任务级依赖关系。在多种操作基准测试中,iSTAR 实现了比上下文和端到端 VLA 基线更可靠的任务分解和更高的成功率,证明了参数空间结构推理对于功能分化和跨任务变体改进泛化能力的有效性。

关键词

引用

@article{arxiv.2602.07541,
  title  = {Differentiate-and-Inject: Enhancing VLAs via Functional Differentiation Induced by In-Parameter Structural Reasoning},
  author = {Jingyi Hou and Leyu Zhou and Chenchen Jing and Jinghan Yang and Xinbo Yu and Wei He},
  journal= {arXiv preprint arXiv:2602.07541},
  year   = {2026}
}