中文

MOST:基于时序剪辑 Banzhaf 互动的运动扩散模型用于稀有文本

计算机视觉与模式识别 2025-07-10 v1

摘要

我们提出 MOST,一种通过时序剪辑 Banzhaf 互动的运动扩散模型,旨在解决从稀有语言提示生成人类运动的持久挑战。虽然前述方法在粗粒度匹配方面不足,且忽视了由于运动冗余导致的重要语义线索,但我们的关键洞察在于利用细粒度剪辑关系来缓解这些问题。MOST 的检索阶段提出了首个时序剪辑 Banzhaf 互动形式,通过 clip 级别精确量化文本-运动一致性,实现直接、细粒度的文本到运动 clip 匹配,消除常见冗余。生成阶段,运动提示模块有效利用检索到的运动 clip 以产生语义一致的运动。广泛的评估表明,MOST 在文本到运动检索和生成方面实现了最先进的性能,通过全面解决前述挑战,定性和定量结果均凸显其有效性,尤其在稀有提示下效果显著。

关键词

引用

@article{arxiv.2507.06590,
  title  = {MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction},
  author = {Yin Wang and Mu li and Zhiying Leng and Frederick W. B. Li and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2507.06590},
  year   = {2025}
}