GPT-Connect:以无训练方式实现文本驱动人体动作生成器与3D场景的交互
计算机视觉与模式识别
2024-03-25 v1
摘要
近年来,尽管文本驱动的人体动作生成受到了大量研究关注,但大多数现有的文本驱动动作生成器通常仅在空白背景下生成动作序列。然而在实际中,人类自然地是在3D场景而非空白背景中执行动作。考虑到这一点,我们在此旨在实现场景感知的文本驱动动作生成。但是,直觉上以监督方式训练一个单独的场景感知动作生成器,可能需要在大规模不同的3D场景中麻烦地收集和标注大量动作样本。为了以相对便捷的方式处理这一任务,本文提出了一种新颖的GPT-Connect框架。在GPT-Connect中,我们利用ChatGPT将现有的动作生成器与3D场景以完全无训练的方式连接起来,从而直接利用现有的空白背景人体动作生成器生成场景感知的动作序列。大量实验证明了我们提出的框架的有效性和泛化能力。
引用
@article{arxiv.2403.14947,
title = {GPT-Connect: Interaction between Text-Driven Human Motion Generator and 3D Scenes in a Training-free Manner},
author = {Haoxuan Qu and Ziyan Guo and Jun Liu},
journal= {arXiv preprint arXiv:2403.14947},
year = {2024}
}