面向视觉-语言长时程任务规划的结构化偏好优化
计算机视觉与模式识别
2025-09-18 v4 人工智能
计算与语言
摘要
现有的视觉-语言任务规划方法在短时程任务中表现优异,但在动态环境下的复杂长时程规划中往往表现不佳。这些挑战主要源于难以有效地训练模型为长时程任务生成高质量的推理过程。为解决此问题,我们提出了结构化偏好优化 (Structured Preference Optimization, SPO),旨在通过结构化偏好评估和优化的训练策略来增强长时程任务规划中的推理与动作选择。具体而言,SPO 引入了:1) 基于偏好的评分与优化,根据任务相关性、视觉定位和历史一致性系统地评估推理链;以及 2) 课程引导训练,模型从简单任务逐步适应到复杂任务,提升其在长时程场景中的泛化能力并增强推理鲁棒性。为推进视觉-语言长时程任务规划的研究,我们引入了 ExtendaBench,这是一个涵盖 VirtualHome 和 Habitat 2.0 中 1,509 个任务的综合性基准,分为超短、短、中等和长任务。实验结果表明,SPO 显著提升了推理质量和最终决策准确率,在长时程任务上优于先前方法,凸显了偏好驱动优化在视觉-语言任务规划中的有效性。具体而言,与表现最佳的基线相比,SPO 在 VirtualHome 上实现了 +5.98% 的 GCR 和 +4.68% 的 SR 提升,在 Habitat 上实现了 +3.30% 的 GCR 和 +2.11% 的 SR 提升。
引用
@article{arxiv.2502.20742,
title = {Structured Preference Optimization for Vision-Language Long-Horizon Task Planning},
author = {Xiwen Liang and Min Lin and Weiqi Ruan and Rongtao Xu and Yuecheng Liu and Jiaqi Chen and Bingqian Lin and Yuzheng Zhuang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2502.20742},
year = {2025}
}
备注
18 pages