中文

面向视频融合的时空一致性多模态方法 TemCoCo:视觉-语义协作

计算机视觉与模式识别 2025-08-26 v1

摘要

现有的多模态融合方法通常直接将静态帧基于图像的融合技术应用于视频融合任务,忽视了视频中固有的时序依赖性,导致跨帧结果不一致。为此,我们提出首个显式融合时序建模与视觉-语义协作的视频融合框架,以同时确保视觉保真度、语义准确性和时序一致性。首先,我们引入视觉-语义交互模块,包含语义分支和视觉分支,分别采用 Dinov2 和 VGG19 进行针对性蒸馏,实现视觉与语义表示的同步提升。其次,我们首次将视频退化增强任务整合到视频融合流水线中,通过构建时序协作模块,利用时序依赖性促进弱信息恢复。再次,为确保时序一致性,我们嵌入时序增强机制并设计时序损失以引导优化过程。最后,我们提出两项创新评估指标,旨在评估生成视频融合结果的时序一致性。广泛的公开视频数据集上的实验结果表明,我们的方法优于现有方法。我们的代码已发布:https://github.com/Meiqi-Gong/TemCoCo。

关键词

引用

@article{arxiv.2508.17817,
  title  = {TemCoCo: Temporally Consistent Multi-modal Video Fusion with Visual-Semantic Collaboration},
  author = {Meiqi Gong and Hao Zhang and Xunpeng Yi and Linfeng Tang and Jiayi Ma},
  journal= {arXiv preprint arXiv:2508.17817},
  year   = {2025}
}

备注

Accepted by ICCV 2025