并非所有帧都相等:基于运动光谱描述符的复杂度感知掩码运动生成
计算机视觉与模式识别
2026-04-01 v1
摘要
掩码生成模型已成为文本到运动合成的强大范式,但仍在掩码、注意力和解码时将运动帧处理得过于均匀。这与运动中局部动态复杂度随时间急剧变化的事实不符。我们指出,当前的掩码运动生成器在动态复杂运动上的性能退化显著,且帧级生成误差与运动动态性强相关。基于这一不匹配,我们引入运动光谱描述符(MSD),这是一种计算自运动速度短时频谱的局部动态复杂度度量方法,简单且无需调参。不同于学习的难度预测器,MSD 是确定性的、可解释的,并且直接来自运动信号本身。我们使用 MSD 实现掩码运动生成的复杂度感知。具体而言,MSD 指导训练中的内容聚焦掩码,为自注意力提供光谱相似性先验,亦可调制解码器中的 token 级采样。基于掩码运动生成器构建的我们的方法,名为 DynMask,在动态复杂运动上显著提升了运动生成效果,同时在 HumanML3D 和 KIT-ML 上实现更高的整体 FID 分数。这些结果表明,尊重局部运动复杂度是掩码运动生成的有用设计原则。项目页面:https://xiangyue-zhang.github.io/DynMask
引用
@article{arxiv.2603.29655,
title = {Not All Frames Are Equal: Complexity-Aware Masked Motion Generation via Motion Spectral Descriptors},
author = {Pengfei Zhou and Xiangyue Zhang and Xukun Shen and Yong Hu},
journal= {arXiv preprint arXiv:2603.29655},
year = {2026}
}