BAMM:双向自回归运动模型
计算机视觉与模式识别
2024-04-02 v3
摘要
从文本生成人体动作一直由去噪动作模型主导,其实现方式包括扩散过程或生成式掩码过程。然而,这些模型由于需要预先知道动作长度,在可用性上面临很大限制。相反,自回归动作模型通过自适应预测动作端点解决了这一限制,但代价是生成质量和编辑能力的下降。为了应对这些挑战,我们提出了双向自回归运动模型(BAMM),一种新颖的文本到动作生成框架。BAMM 包含两个关键组件:(1)一个动作分词器,将 3D 人体动作转换为潜在空间中的离散 token;(2)一个掩码自注意力 Transformer,通过混合注意力掩码策略自回归地预测随机掩码 token。通过统一生成式掩码建模和自回归建模,BAMM 捕捉了动作 token 之间丰富且双向的依赖关系,同时学习了从文本输入到动作输出的概率映射,并具有动态调整的动作序列长度。这一特性使 BAMM 能够在实现高质量动作生成的同时,增强可用性并具备内置的动作可编辑性。在 HumanML3D 和 KIT-ML 数据集上的大量实验表明,BAMM 在定性和定量指标上均超越了当前最先进的方法。我们的项目主页位于 https://exitudio.github.io/BAMM-page
引用
@article{arxiv.2403.19435,
title = {BAMM: Bidirectional Autoregressive Motion Model},
author = {Ekkasit Pinyoanuntapong and Muhammad Usama Saleem and Pu Wang and Minwoo Lee and Srijan Das and Chen Chen},
journal= {arXiv preprint arXiv:2403.19435},
year = {2024}
}