中文

L3GO:基于三维思维链的语言智能体用于生成非常规物体

人工智能 2024-02-15 v1

摘要

基于扩散的图像生成模型(如 DALL-E 3 和 Stable Diffusion-XL)在生成具有逼真且独特构图的图像方面展现出卓越的能力。然而,这些模型在精确推理物体的物理和空间配置方面并不稳健,尤其是在面对非常规的、因而属于分布外描述(例如“一把有五条腿的椅子”)时。本文提出了一种基于三维思维链的语言智能体(L3GO),这是一种推理时方法,能够对当前数据驱动的扩散模型难以处理的非常规物体进行基于部件的三维网格生成推理。更具体地说,我们使用大型语言模型作为智能体,在三维仿真环境中通过试错来组合出期望的物体。为便于研究,我们开发了一个新的基准测试集——非常规可行物体(UFO),以及一个基于 Blender 构建的封装环境 SimpleBlenv,语言智能体可在其中通过 API 调用构建和组合原子构建块。人工评估和自动 GPT-4V 评估表明,在 ShapeNet 上的三维网格生成任务中,我们的方法超越了标准 GPT-4 及其他语言智能体(如 ReAct 和 Reflexion)。此外,在我们的 UFO 基准测试中,基于人工评估,我们的方法优于其他最先进的文本到二维图像和文本到三维模型。

关键词

引用

@article{arxiv.2402.09052,
  title  = {L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional Objects},
  author = {Yutaro Yamada and Khyathi Chandu and Yuchen Lin and Jack Hessel and Ilker Yildirim and Yejin Choi},
  journal= {arXiv preprint arXiv:2402.09052},
  year   = {2024}
}