探索视频理解的高阶自相似性
计算机视觉与模式识别
2026-04-23 v1
摘要
空间时间自相似性 (STSS) 通过跨帧捕获视觉对应关系,为视频理解的时序动态表示提供了有效方法。本文探索了更高阶的 STSS,表明不同阶数的 STSS 揭示了这些动态的不同方面。我们随后引入 Multi-Order Self-Similarity (MOSS) 模块,一个轻量级神经模块,旨在学习和集成多阶 STSS 特征。它可以应用于多样化的视频任务,以提升运动建模能力,同时仅增加极少的计算成本和内存使用。大量实验在视频动作识别、基于运动的视频问答和实际机器人任务上持续显示显著的改进,验证了 MOSS 作为通用时序建模模块的广泛适用性。源代码和模型权重将公开提供。
引用
@article{arxiv.2604.20760,
title = {Exploring High-Order Self-Similarity for Video Understanding},
author = {Manjin Kim and Heeseung Kwon and Karteek Alahari and Minsu Cho},
journal= {arXiv preprint arXiv:2604.20760},
year = {2026}
}