从试错中学习:为具身 LLM 提供反思性测试时规划
摘要
具身 LLM 为机器人提供了高层次任务推理能力,但它们无法反思错误的原因,从而将部署变为一系列独立的试验,其中错误会重复而非积累为经验。drawing upon human reflective practitioners, 我们引入反思性测试时规划,将两种反思模式集成其中:一种是行动中的反思(reflection-in-action),即代理通过测试时扩展生成并评分多个候选动作以进行内部反思后再执行;另一种是行动后的反思(reflection-on-action),即通过测试时训练来更新其内部反思模型和动作策略 based on 执行后的外部反思。我们还包括回顾性反思(retrospective reflection),允许代理对早先的决定进行重新评估,并以事后方式进行模型更新以实现更长期的信用分配。我们在新设计的 Long-Horizon Household benchmark 和 MuJoCo Cupboard Fitting benchmark 上进行实验,显示相对于基线模型具有显著提升,实现了对 photorealistic HM3D 环境和 Franka Panda 机械臂上的零样本泛化。消融实验确认行动中的反思与行动后的反思是相互依赖的,回顾性反思在较低计算开销下实现了比逐步外部反馈更好的信用分配。定性分析进一步突出了通过反思实现的行为纠正。
引用
@article{arxiv.2602.21197,
title = {Variants of Raviart-Thomas mixed elements for curved domains using straight-edged tetrahedra},
author = {Vittoriano Ruas},
journal= {arXiv preprint arXiv:2602.21197},
year = {2026}
}
备注
This pre-publication is the same as the initial version of the manuscript submitted to (Springer) Journal of Scientific Computing, except for its abridged title and the dedication. It was accepted for publication by this journal in revised and improved form on February 21, 2026