ActPlan-1K:评估视觉语言模型在家庭活动中的程序规划能力
计算与语言
2024-10-08 v1
摘要
大语言模型(LLMs)因其强大的推理能力被采纳来处理文本任务描述并在具身 AI 任务中实现程序规划。然而,针对多模态任务输入,视觉语言模型(VLMs)的行为仍缺乏研究。也未充分探讨如何评估模型在备选任务情境下的推理能力。为评估两种多模态和备选情境的规划能力,我们提出了 ActPlan-1K。ActPlan-1K 基于 ChatGPT 和家庭活动模拟器 iGibson2 构建的多模态规划基准。该基准包含 153 项活动和 1,187 个实例。每个实例包含自然语言任务描述和来自模拟器的多个环境图像。每个实例的金标准计划是针对提供场景中对象的动作序列。对典型 VLMs 来说,评估其在正常活动和备选活动中的程序计划的正确性和常识满足度。结果显示,当前 VLMs 在生成人类水平的程序计划方面在正常活动和备选活动方面仍面临挑战。我们进一步通过在 BLEURT 模型上微调提供自动评估指标,以促进本基准的后续研究。
引用
@article{arxiv.2410.03907,
title = {ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities},
author = {Ying Su and Zhan Ling and Haochen Shi and Jiayang Cheng and Yauwai Yim and Yangqiu Song},
journal= {arXiv preprint arXiv:2410.03907},
year = {2024}
}
备注
13 pages, 9 figures, 8 tables, accepted to EMNLP 2024 main conference