中文

AvatarGPT:面向运动理解、规划、生成及更多任务的通用一体化框架

计算机视觉与模式识别 2023-11-29 v1

摘要

大语言模型(LLMs)在统一几乎所有(即便不是全部)自然语言处理任务方面展现出了显著的涌现能力。然而,在人体运动相关领域,研究者仍针对每个任务分别开发孤立的模型。受 InstuctGPT 以及 Gato 背后的通才概念启发,我们提出了 AvatarGPT,一个用于运动理解、规划、生成以及其他任务(如运动中间帧合成)的通用一体化(All-in-One)框架。AvatarGPT 将每个任务视为共享 LLM 上微调的一种指令。所有任务以语言作为通用接口无缝互联,在框架内构成闭环。为实现这一点,人体运动序列首先被编码为离散 token,作为 LLM 的扩展词表。随后,我们开发了一条从无标注网络视频中生成人体动作序列自然语言描述的无监督流水线。最后,所有任务被联合训练。大量实验表明,AvatarGPT 在低层任务上达到了 SOTA,在高层任务上取得了有前景的结果,证明了我们所提一体化框架的有效性。此外,AvatarGPT 首次实现了一种原则性方法,通过在闭环内迭代遍历各任务来进行无限长运动合成。

关键词

引用

@article{arxiv.2311.16468,
  title  = {AvatarGPT: All-in-One Framework for Motion Understanding, Planning, Generation and Beyond},
  author = {Zixiang Zhou and Yu Wan and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2311.16468},
  year   = {2023}
}

备注

22 pages, 21 figures