结构化自洽性:LLM 在 VirtualHome 上的多任务评估
人工智能
2026-02-04 v2
摘要
具身 AI 需要代理人理解目标、规划动作并在仿真环境中执行任务。我们采用具身代理人界面 (EAI) 框架,对大语言模型 (LLM) 在 VirtualHome 基准上的表现进行全面评估。我们比较了两个代表性 7B 参数模型 OPENPANGU-7B 和 QWEN2.5-7B,涵盖四个基本任务:目标解释、动作序列、子目标分解和转换建模。我们提出结构化自洽性 (SSC),这是一种增强解码策略,利用多个抽样结合领域特定投票机制以提高结构化生成任务的输出质量。实验结果表明,SSC显著提升了性能,OPENPANGU-7B 在层次化规划方面表现突出,而 QWEN2.5-7B 在动作层面任务中表现出优势。我们的分析揭示了不同模型类型的互补优势,为未来具身 AI 系统的开发提供了洞见。
关键词
引用
@article{arxiv.2602.00611,
title = {Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome},
author = {Jiaqi Xu and Tao Huang and Kai Zhang},
journal= {arXiv preprint arXiv:2602.00611},
year = {2026}
}