中文

MotionCFG:通过随机概念扰动提升运动动态

计算机视觉与模式识别 2026-03-17 v1 人工智能 机器学习

摘要

尽管近期在文本到视频(Text-to-Video,T2V)合成方面取得了进展,但生成高保真且动态的运动仍是一大挑战。现有方法主要依赖分类器自由指导 (Classifier-Free Guidance,CFG),常伴随显式负面提示词(如“静态”、“模糊”),以抑制不良 artifacts。然而,这类显式否定常引入意外的语义偏差并扰乱物体完整性;我们定义这种现象为内容-运动漂移(Content-Motion Drift)。为解决此问题,本文提出MotionCFG框架,通过与其噪声扰动后果进行对比来增强运动动态。具体而言,通过向概念嵌入注入高斯噪声,MotionCFG创建局部负锚点,封装广泛的亚最优运动变体的互补空间。不同于显式否定,此方法实现隐式硬负采矿,无需改变全局语义身份,从而实现对时序细节的聚焦优化。结合分段指导计划,将干预限制在早期去噪步骤中,MotionCFG在各类先进T2V框架上均能以可忽略的计算开销和最小程度的视觉质量牺牲,持续提升运动动态。此外,我们展示,这种噪声引导的对比机制不仅适用于锐化运动轨迹,还能有效引导精确的对象数目等复杂非线性概念,这些通常难以通过标准文本指导加以调节。

关键词

引用

@article{arxiv.2603.14073,
  title  = {MotionCFG: Boosting Motion Dynamics via Stochastic Concept Perturbation},
  author = {Byungjun Kim and Soobin Um and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2603.14073},
  year   = {2026}
}