中文

聚焦注意力,行动更佳:利用注意力机制进行交互式运动生成与无训练编辑

计算机视觉与模式识别 2025-01-23 v2

摘要

本研究聚焦于人类运动生成的交互式编辑问题。以往的运动扩散模型缺乏对词级文本-运动对应关系的显式建模和良好的可解释性,从而限制了其细粒度编辑能力。为此,我们提出一种基于注意力的运动扩散模型,称为 MotionCLR,通过 CLeaR(Clear)建模注意力机制。技术上,MotionCLR 使用自注意力和交叉注意力分别建模内部模态和跨模态互动。更具体地说,自注意力机制旨在衡量帧之间的序列相似性,并影响运动特征的顺序。相比之下,交叉注意力机制用于寻找词-序列之间的细粒度对应关系,并激活运动序列中的相应时间步。基于这些关键特性,我们开发了一套简单而有效的运动编辑方法,通过操控注意力图实现运动(de-)强调、原位运动替换和基于示例的运动生成等。为进一步验证注意力机制的可解释性,我们还探讨了通过注意力图实现动作计数和具身运动生成能力的潜力。我们的实验结果表明,该方法在生成和编辑能力方面表现良好,同时具备良好的可解释性。

关键词

引用

@article{arxiv.2410.18977,
  title  = {Pay Attention and Move Better: Harnessing Attention for Interactive Motion Generation and Training-free Editing},
  author = {Ling-Hao Chen and Shunlin Lu and Wenxun Dai and Zhiyang Dou and Xuan Ju and Jingbo Wang and Taku Komura and Lei Zhang},
  journal= {arXiv preprint arXiv:2410.18977},
  year   = {2025}
}

备注

Updated MotionCLR technical report