中文

基于层次化潜在扩散和语言模型的协作式人类-智能体交互生成框架 COLLAGE

机器学习 2024-10-01 v1 人工智能 计算机视觉与模式识别 图形学

摘要

我们提出了一种新型框架 COLLAGE,用于利用大语言模型 (LLM) 和层次化运动特定向量量化变分自编码器 (VQ-VAEs) 生成由智能体-对象-智能体构成的协作交互。我们的模型通过整合 LLM 的知识和推理能力来指导生成式扩散模型,从而解决该领域丰富数据稀缺的问题。层次化 VQ-VAE 架构在多个抽象层次上捕获不同的运动特性,避免冗余概念,实现高效的多分辨率表示。我们引入一种在潜在空间中运行的扩散模型,并融合 LLM 生成的运动规划线索,以引导去噪过程,实现具有更大控制力和多样性的特定提示下的运动生成。在 CORE-4D 和 InterHuman 数据集上的实验结果表明,我们的方法在生成真实且多样化的协作式人类-对象-人类交互方面有效且优于最先进的方法。我们的工作开拓了在机器人、图形学和计算机视觉等多个领域建模复杂交互的新可能性。

关键词

引用

@article{arxiv.2409.20502,
  title  = {COLLAGE: Collaborative Human-Agent Interaction Generation using Hierarchical Latent Diffusion and Language Models},
  author = {Divyanshu Daiya and Damon Conover and Aniket Bera},
  journal= {arXiv preprint arXiv:2409.20502},
  year   = {2024}
}

备注

9 pages, 6 figures