中文

SemanticMoments:基于第三矩特征的无训练运动相似性

计算机视觉与模式识别 2026-02-11 v1

摘要

基于语义运动检索视频是基本且尚未解决的问题。现有的视频表示方法过度依赖静态外观和场景上下文,而这种偏差继承自其训练数据和目标。相反,传统的运动导向输入如光流缺乏足以理解高层次运动的语义 grounding。为说明这种固有偏差,我们引入 SimMotion 基准测试,结合受控合成数据与新的人工标注真实数据集。我们展示,现有模型在这些基准测试上的表现不佳,往往难以消除运动与外观。为解决这一问题,我们提出 SemanticMoments—a 一个简单、无训练的方法,通过对预训练语义模型的特征在时间上计算统计量(具体而言,更高阶矩)来实现。我们在所有基准测试上都显示,SemanticMoments 持续优于现有的 RGB、flow 和 text-supervised 方法。这表明,语义特征空间中的时间统计量为运动导向的视频理解提供了可扩展且感知上可靠的基础。

关键词

引用

@article{arxiv.2602.09146,
  title  = {SemanticMoments: Training-Free Motion Similarity via Third Moment Features},
  author = {Saar Huberman and Kfir Goldberg and Or Patashnik and Sagie Benaim and Ron Mokady},
  journal= {arXiv preprint arXiv:2602.09146},
  year   = {2026}
}