MOST:基于时序剪辑 Banzhaf 互动的运动扩散模型用于稀有文本
计算机视觉与模式识别
2025-07-10 v1
摘要
我们提出 MOST,一种通过时序剪辑 Banzhaf 互动的运动扩散模型,旨在解决从稀有语言提示生成人类运动的持久挑战。虽然前述方法在粗粒度匹配方面不足,且忽视了由于运动冗余导致的重要语义线索,但我们的关键洞察在于利用细粒度剪辑关系来缓解这些问题。MOST 的检索阶段提出了首个时序剪辑 Banzhaf 互动形式,通过 clip 级别精确量化文本-运动一致性,实现直接、细粒度的文本到运动 clip 匹配,消除常见冗余。生成阶段,运动提示模块有效利用检索到的运动 clip 以产生语义一致的运动。广泛的评估表明,MOST 在文本到运动检索和生成方面实现了最先进的性能,通过全面解决前述挑战,定性和定量结果均凸显其有效性,尤其在稀有提示下效果显著。
引用
@article{arxiv.2507.06590,
title = {MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction},
author = {Yin Wang and Mu li and Zhiying Leng and Frederick W. B. Li and Xiaohui Liang},
journal= {arXiv preprint arXiv:2507.06590},
year = {2025}
}