世界建模提升规划器性能:双偏好优化用于具身任务规划
计算与语言
2025-03-14 v1 计算机视觉与模式识别
机器人学
摘要
近期大型视觉语言模型(LVLMs)在具身任务规划方面取得了显著进展,但仍面临依赖约束和效率等根本性挑战。现有方法要么仅优化动作选择,要么在推理过程中利用世界模型,忽略了将世界建模作为提升规划能力的潜在优势。我们提出双偏好优化(DPO),一种新的学习框架,通过偏好学习联合优化状态预测和动作选择,使LVLMs能够理解环境动态以实现更好的规划。为自动收集无需人工标注的轨迹和逐步偏好数据,我们引入基于树搜索的机制进行大规模探索。针对VoTa-Bench上的大量实验表明,我们的DPO方法在Qwen2-VL(7B)、LLaVA-1.6(7B)和LLaMA-3.2(11B)上显著优于现有方法和GPT-4o,实现更高的任务成功率,同时执行路径更为高效。
引用
@article{arxiv.2503.10480,
title = {World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning},
author = {Siyin Wang and Zhaoye Fei and Qinyuan Cheng and Shiduo Zhang and Panpan Cai and Jinlan Fu and Xipeng Qiu},
journal= {arXiv preprint arXiv:2503.10480},
year = {2025}
}