VQ-Style:离散化表示下的运动风格与内容解耦
计算机视觉与模式识别
2026-02-27 v2 人工智能
机器学习
摘要
人类运动数据本质上富集且复杂,包含语义内容以及难以建模的细微风格特征。我们提出一种新方法,用于有效地将运动数据中的风格与内容进行解耦,以便于风格迁移。我们的方法依据以下洞见进行引导:内容对应粗糙的运动属性,而风格捕捉更细致、更具表达力的细节。为建模这种层次结构,我们采用残差向量量化变分自编码器(RVQ-VAEs)来学习运动的粗到细的表征。我们进一步通过集成码表学习、对比学习以及一种新颖的信息泄漏损失来增强解耦效果,以在不同码表之间组织内容与风格。我们利用这种解耦表征,通过一种简单有效的推理时技术——量化码交换(Quantized Code Swapping),实现运动风格迁移,而无需对未见的风格进行任何微调。我们的框架在多个推理应用方面表现出强大的通用性,包括风格迁移、风格去除和运动混合。
引用
@article{arxiv.2602.02334,
title = {VQ-Style: Disentangling Style and Content in Motion with Residual Quantized Representations},
author = {Fatemeh Zargarbashi and Dhruv Agrawal and Jakob Buhmann and Martin Guay and Stelian Coros and Robert W. Sumner},
journal= {arXiv preprint arXiv:2602.02334},
year = {2026}
}