基于解耦精炼的无语言组合动作生成
计算机视觉与模式识别
2024-01-09 v3
摘要
将简单元素组合为复杂概念至关重要却具挑战性,对于3D动作生成尤为如此。现有方法很大程度上依赖大量的神经语言标注来辨识可组合的潜在语义,这一过程通常成本高昂且劳动密集。在本研究中,我们引入一种无需依赖语言辅助即可生成组合动作的新框架。我们的方法由三个主要组件构成:动作耦合、条件动作生成与解耦精炼。动作耦合利用能量模型提取每个子动作的注意力掩码,随后使用这些注意力整合两个动作以生成伪训练样本。接着,我们采用条件生成模型CVAE学习潜在空间,以促进多样化生成。最后,我们提出解耦精炼,利用自监督预训练模型MAE确保子动作与组合动作间的语义一致性。该精炼过程将生成的3D动作渲染至2D空间,将这些图像解耦为两个子段,使用MAE模型从子段恢复完整图像,并约束恢复图像与由原始子动作渲染的图像相匹配。由于缺乏同时包含子动作与组合动作的现有数据集,我们创建了两个新数据集,命名为HumanAct-C与UESTC-C,并给出相应评估指标。我们进行了定性与定量评估以展示我们的有效性。
引用
@article{arxiv.2307.03538,
title = {Language-free Compositional Action Generation via Decoupling Refinement},
author = {Xiao Liu and Guangyi Chen and Yansong Tang and Guangrun Wang and Xiao-Ping Zhang and Ser-Nam Lim},
journal= {arXiv preprint arXiv:2307.03538},
year = {2024}
}
备注
14 pages