Motion-Adapter:用于复合动作文本到动作生成的扩散模型适配器
计算机视觉与模式识别
2026-05-05 v2
摘要
近期的生成式运动合成技术已实现从多样输入模态生成逼真的人类动作,但从文本合成复合动作——将多个并发动作整合为连贯的全身动作序列——仍是主要挑战。我们确定了当前文本到动作扩散模型中的两个关键局限:(i) 灾难性忽视,后续动作因不当处理时序信息而覆盖早期动作;(ii) 注意力坍缩,源于跨注意力机制中的过度特征融合。结果,现有方法常依赖过于详细的文本描述(如抬举右手)、显式的身体部位指定(如编辑上半身)或大语言模型(LLM)进行身体部位解释。这些策略导致对物理结构和运动学机制的语义表示不足,限制了能够自然融入如“走路打招呼”等行为的能力。为解决此问题,我们提出 Motion-Adapter,一个即插即用的模块,通过计算解耦的跨注意力图作为结构掩码,在去噪过程中指导文本到动作扩散模型生成复合动作。广泛的实验表明,我们的方法在多样化文本提示下 consistently 生成更忠实且连贯的复合动作,超越了最先进的方法。
引用
@article{arxiv.2604.16135,
title = {Motion-Adapter: A Diffusion Model Adapter for Text-to-Motion Generation of Compound Actions},
author = {Yue Jiang and Mingyu Yang and Liuyuxin Yang and Yang Xu and Bingxin Yun and Yuhe Zhang},
journal= {arXiv preprint arXiv:2604.16135},
year = {2026}
}
备注
12 pages, 12 figures. This work has been submitted to the IEEE Transactions on Visualization and Computer Graphics for possible publication