中文

超编码网络:面向视频理解的递归多模态编码器关联

计算机视觉与模式识别 2025-12-23 v2

摘要

视频理解被视为通向世界建模的关键步骤,这是人工智能研究中的一个长期问题。最近,多模态基础模型通过大规模预训练展现了潜力,这些模型有效地通过对比学习对齐不同模态的编码器。为进一步提升对复杂目标运动和多样化视频场景的表现,我们提出通过更深入的多模态交互来增强这种对齐,这对于理解具有多样化视频场景的复杂目标运动至关重要。为填补这一空白,我们提出一种统一的超编码网络 (SEN) 用于视频理解,通过基础模型中多模态编码器的递归关联来构建此类distinct 交互。具体而言,我们创造性地将这些经过训练的编码器视为我们的 SEN 中的 "超神经元"。通过设计递归关联 (RA) 模块,我们基于超神经元的知识整合、分配和提示,以递归方式逐步融合多模态信息。如此一来,我们的 SEN 能有效地为下游的各种视频理解任务进行更深层次的多模态交互编码。广泛的实验表明,我们的 SEN 能显著提升四个最具代表性的视频任务,包括跟踪、识别、对话和编辑。例如,对于像素级跟踪,平均 Jaccard 指数提高 2.7%,而时间一致性 (TC) 下降 8.8%,与流行的 CaDeX++ 方法相比。对于一个样本的视频编辑,文本对齐提升 6.4%,帧一致性提高 4.1%,与 Tune-A-Video 方法相比。

关键词

引用

@article{arxiv.2506.07576,
  title  = {Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding},
  author = {Boyu Chen and Siran Chen and Kunchang Li and Qinglin Xu and Yu Qiao and Yali Wang},
  journal= {arXiv preprint arXiv:2506.07576},
  year   = {2025}
}