KMM: 用于扩展运动生成的关键帧掩码 Mamba
计算机视觉与模式识别
2025-04-17 v2
摘要
人体运动生成是生成式计算机视觉领域的前沿研究方向,在视频创作、游戏开发和机器人操控中具有广阔的应用前景。近期 Mamba 架构在高效建模长序列和复杂序列方面展现出令人鼓舞的结果,但仍面临两个重大挑战:第一,直接将 Mamba 应用于扩展运动生成效果不佳,因为隐式记忆的容量有限,导致记忆衰减;第二,Mamba 在多模态融合方面相比 Transformer 存在困难,且与文本查询的对齐不足,经常混淆方向(左或右)或遗漏较长文本查询的部分内容。为应对这些挑战,本文提出了三项关键贡献:第一,我们提出了 KMM,一种新颖的架构,采用关键帧掩码建模(Key frame Masking Modeling),旨在增强 Mamba 对运动片段中关键动作的关注。该方法解决了记忆衰减问题,并代表了在 SSM 中定制策略性帧级掩码的开创性方法。此外,我们设计了一种对比学习范式,用于解决 Mamba 中的多模态融合问题并改善运动-文本对齐。最后,我们在 go-to 数据集 BABEL 上进行了广泛实验,以比先前最先进方法降低超过 57% 的 FID 和 70% 的参数数量达到了最先进的性能。参见项目网站:https://steve-zeyu-zhang.github.io/KMM
引用
@article{arxiv.2411.06481,
title = {KMM: Key Frame Mask Mamba for Extended Motion Generation},
author = {Zeyu Zhang and Hang Gao and Akide Liu and Qi Chen and Feng Chen and Yiran Wang and Danning Li and Rui Zhao and Zhenming Li and Zhongwen Zhou and Hao Tang and Bohan Zhuang},
journal= {arXiv preprint arXiv:2411.06481},
year = {2025}
}