通过残差向量量化使姿态表示更具表达力与解耦性
计算机视觉与模式识别
2025-08-21 v1 机器人学
摘要
文本到动作生成的最新进展推动了3D人体运动生成和基于文本的运动控制。可控运动生成(CoMo)能够实现直观控制,通常依赖于姿态编码表示,但仅靠离散姿态编码无法捕捉细粒度的运动细节,限制了表达力。为克服这一局限,我们提出一种方法,利用残差向量量化(RVQ)以连续运动特征增强基于姿态编码的潜在表示。该设计保留了姿态编码的可解释性和可操控性,同时有效捕捉高频细节等细微运动特征。在HumanML3D数据集上的实验表明,我们的模型将Fréchet初始距离(FID)从0.041降至0.015,并将Top-1 R-Precision从0.508提升至0.510。对姿态编码间成对方向相似性的定性分析进一步证实了模型在运动编辑中的可控性。
引用
@article{arxiv.2508.14561,
title = {Making Pose Representations More Expressive and Disentangled via Residual Vector Quantization},
author = {Sukhyun Jeong and Hong-Gi Shin and Yong-Hoon Choi},
journal= {arXiv preprint arXiv:2508.14561},
year = {2025}
}