中文

LLaPa:面向反事实感知的程序计划视觉语言模型框架

计算与语言 2025-07-14 v1

摘要

尽管大型语言模型(LLM)通过强大的推理能力在具身AI系统中取得了程序计划的进步,但多模态输入和反事实推理的集成仍受到不足关注。为此,我们引入LLaPa——一个面向多模态程序计划的视觉语言模型框架。LLaPa利用视觉语言模型(VLM)从文本任务描述和视觉环境图像中生成可执行的动作序列。此外,我们增强了LLaPa,加入两个辅助模块以提升程序计划能力。第一个模块是任务-环境重排序器(TER),它利用任务导向分段技术构建任务敏感特征空间,将文本描述与视觉环境对齐,并突出程序执行的关键区域。第二个模块是反事实活动检索器(CAR),识别并突出潜在的反事实条件,增强模型在反事实情境下的推理能力。针对ActPlan-1K和ALFRED基准进行的大规模实验表明,LLaPa生成的计划质量更高,LCS和正确性均优于先进模型。代码和模型已公开于https://github.com/sunshibo1234/LLaPa。

关键词

引用

@article{arxiv.2507.08496,
  title  = {LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning},
  author = {Shibo Sun and Xue Li and Donglin Di and Mingjie Wei and Lanshun Nie and Wei-Nan Zhang and Dechen Zhan and Yang Song and Lei Fan},
  journal= {arXiv preprint arXiv:2507.08496},
  year   = {2025}
}