CoMo:通过语言引导的姿态码编辑实现可控动作生成
计算机视觉与模式识别
2024-09-20 v2
摘要
文本到动作模型在高效的人体动作生成方面表现出色,但现有方法在生成过程中缺乏细粒度的可控性。因此,修改动作中的细微姿态或在特定时刻插入新动作仍然是一个挑战,限制了这些方法在多样化场景中的适用性。鉴于这些挑战,我们引入了 CoMo,一种可控动作生成模型,它通过利用大型语言模型 (LLMs) 的知识先验,擅长准确地生成和编辑动作。具体而言,CoMo 将动作分解为离散且具有语义意义的姿态码,每个码封装了身体某一部分的语义,表示诸如“左膝微曲”之类的基本信息。给定文本输入,CoMo 自回归地生成姿态码序列,随后将其解码为 3D 动作。利用姿态码作为可解释的表示,LLM 可以通过根据编辑指令调整姿态码,直接干预动作编辑。实验表明,CoMo 在动作生成方面取得了与 SOTA 模型相当的性能;而在人类评估中,CoMo 在动作编辑能力上大幅超越了先前的工作。
引用
@article{arxiv.2403.13900,
title = {CoMo: Controllable Motion Generation through Language Guided Pose Code Editing},
author = {Yiming Huang and Weilin Wan and Yue Yang and Chris Callison-Burch and Mark Yatskar and Lingjie Liu},
journal= {arXiv preprint arXiv:2403.13900},
year = {2024}
}