中文

基于大型语言模型的布局生成智能体

人机交互 2024-05-15 v1 人工智能

摘要

近年来,对可定制 3D 虚拟空间的需求日益增加。由于创建这些虚拟空间需要大量的人力,因此需要提高虚拟空间创建的效率。虽然现有研究提出了自动生成平面图和家具布置等布局的方法,但这些方法仅根据用户指令生成指示布局结构的文本,并未利用生成过程中获得的信息。在本研究中,我们提出了一种使用 GPT-4V 多模态大型语言模型的智能体驱动布局生成系统,并验证了其有效性。具体而言,语言模型操纵智能体在虚拟空间中依次放置对象,从而生成反映用户指令的布局。实验结果证实,我们提出的方法能够以高成功率生成反映用户指令的虚拟空间。此外,我们通过消融研究成功识别了有助于提升行为生成性能的要素。

关键词

引用

@article{arxiv.2405.08037,
  title  = {Layout Generation Agents with Large Language Models},
  author = {Yuichi Sasazawa and Yasuhiro Sogawa},
  journal= {arXiv preprint arXiv:2405.08037},
  year   = {2024}
}