面向视觉-语言-动作模型的推理时学习 affordances
机器人学
2025-10-23 v1 人工智能
摘要
解决复杂的真实世界控制任务通常需要多次尝试:如果我们第一次失败了,就会反思是什么导致了失败,相应地改变策略以避免再次出错。在机器人领域,视觉-语言-动作模型 (VLA) 为解决复杂控制任务提供了有前景的道路,但缺乏在失败后对行为进行情境化和动态调整的能力。本文引入了 Learning from Inference-Time Execution (LITEN),将 VLA 低层策略与高层 VLM 连接起来,通过包括其在情境中的过往经验来学习低层 VLA 的 affordances 和能力。我们的 метод 在推理阶段生成并执行低层 VLA 的计划之间进行迭代,随后在评估阶段对所产生的执行结果进行反思,并得出可用于未来推理情境的有用结论。与非机器人领域中类似的自校准方法不同,LITEN 必须反思非结构化的真实世界机器人轨迹(例如原始视频),这需要在评估阶段提供结构化的引导。我们的实验结果表明,LITEN 能够有效地从过往经验中学习,以生成高 affordance 指令来完成长期任务。
关键词
引用
@article{arxiv.2510.19752,
title = {Learning Affordances at Inference-Time for Vision-Language-Action Models},
author = {Ameesh Shah and William Chen and Adwait Godbole and Federico Mora and Sanjit A. Seshia and Sergey Levine},
journal= {arXiv preprint arXiv:2510.19752},
year = {2025}
}
备注
7 pages and appendix