对比式世界模型:用于具身智能体管道中的动作可行性学习
人工智能
2026-02-27 v1 机器人学
摘要
可靠的动作可行性评估器是具身智能体管道中的关键瓶颈:在任何规划或推理发生之前,智能体必须识别当前状态下哪些候选动作是物理可执行的。现有方法使用监督微调(SFT)训练动作评估器,但SFT将每个候选动作独立处理,未明确教会模型区分物理上正确与微妙错误的动作。我们提出对比式世界模型(CWM),其通过InfoNCE对比目标对大型语言模型(LLM)进行微调,用硬负样本进行对比学习。核心思想是将有效动作在评分空间中推远离无效动作,特别强调硬负样本:在评分上语义相似但在物理上不兼容的候选方案。我们在ScienceWorld基准上评估了CWM,通过两项研究进行验证。第一项针对605对硬负样本进行内在可行性评估,显示CWM在Precision@1上比SFT提升6.76个百分点(针对最小编辑负样本——即单个词汇改变物理结果的情形),且AUC-ROC为0.929 vs 0.906。第二项为在线过滤特征研究,衡量CWM在任务执行期间如何对金标路径动作在所有有效环境动作中的排序。 在分布外压力条件下,CWM保持更佳的安全裕度(-2.39)相较于SFT(-3.96),表明金标动作被排在更靠前的位置。这些结果支持假设:对比式训练诱导出比SFT alone更忠实地捕获物理可行性的表示。
引用
@article{arxiv.2602.22452,
title = {CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines},
author = {Chayan Banerjee},
journal= {arXiv preprint arXiv:2602.22452},
year = {2026}
}