基于双文本-图像提示的多模态程序性规划
计算与语言
2023-05-04 v1
摘要
具身智能体在遵循人类指令完成任务方面已取得显著性能。然而,提供由文本与图像共同告知的指令以辅助人类完成任务这一潜力仍未被充分探索。为揭示该能力,我们提出多模态程序性规划(MPP)任务,其中模型被给定一个高层目标并生成配对的文本-图像步骤计划,比单模态计划提供更具互补性与信息量的指导。MPP 的关键挑战在于确保跨模态计划的信息量、时间连贯性与准确性。为此,我们提出文本-图像提示(TIP),一种双模态提示方法,联合利用大语言模型(LLM)的零样本推理能力与基于扩散模型的强文本到图像生成能力。TIP 通过文本到图像桥与图像到文本桥改进双模态中的交互,使 LLM 能够引导基于文本的图像计划生成,并利用图像计划的描述反向支撑文本计划。为解决相关数据集的缺乏,我们收集了 WIKIPLAN 与 RECIPEPLAN 作为 MPP 的测试基准。我们的结果显示,在 WIKIPLAN 与 RECIPEPLAN 上,相较于单模态与多模态基线,其在信息量、时间连贯性与计划准确性方面均获得引人注目的人类偏好与自动评分。我们的代码与数据:https://github.com/YujieLu10/MPP。
引用
@article{arxiv.2305.01795,
title = {Multimodal Procedural Planning via Dual Text-Image Prompting},
author = {Yujie Lu and Pan Lu and Zhiyu Chen and Wanrong Zhu and Xin Eric Wang and William Yang Wang},
journal= {arXiv preprint arXiv:2305.01795},
year = {2023}
}