中文

ThinkAct:通过强化视觉潜在规划的视觉语言-动作推理

计算机视觉与模式识别 2025-09-19 v2 人工智能 机器学习 机器人学

摘要

视觉语言-动作 (VLA) 推理任务要求智能体解释多模态指令,在动态环境中进行长期规划并自适应地执行动作。现有方法通常以端到端方式训练VLA模型,直接将输入映射到动作,缺乏显式推理,限制了其在多个步骤上进行规划或适应复杂任务变体的能力。本文提出ThinkAct:一个双系统框架,通过强化视觉潜在规划桥接高层推理与低层动作执行。ThinkAct训练一个多模态LLM生成由强化动作对齐视觉奖励(基于目标完成和轨迹一致性)指导的具身推理计划。这些推理计划被压缩为视觉计划潜在,用于条件化下游动作模型,以实现对目标环境中稳健的动作执行。基于具身推理和机器人操纵基准测试的广泛实验表明,ThinkAct能够在复杂具身AI任务中实现few-shot适应、长期规划和自我纠正行为。

关键词

引用

@article{arxiv.2507.16815,
  title  = {ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning},
  author = {Chi-Pin Huang and Yueh-Hua Wu and Min-Hung Chen and Yu-Chiang Frank Wang and Fu-En Yang},
  journal= {arXiv preprint arXiv:2507.16815},
  year   = {2025}
}

备注

NeurIPS 2025. Project page: https://jasper0314-huang.github.io/thinkact-vla/