多个视频的同步
计算机视觉与模式识别
2025-10-17 v1
摘要
同时从同一场景中由多个摄像机捕获的视频通常容易实现,仅需简单的时移即可。然而,来自不同场景的视频,或更近期的生成式 AI 视频,则面临更复杂的挑战,由于受众、背景和非线性时序错位的差异。我们提出了时间原型学习(TPL),一种基于原型的框架,从由各种预训练模型提取的高维嵌入中构建共享、紧凑的 1D 表示。TPL 通过学习统一的原型序列锚定关键动作阶段,从而避免进行彻底的两两匹配。我们的实验表明,TPL 在各种数据集上提高了同步精度、效率和鲁棒性,包括细粒度帧检索和阶段分类任务。重要的是,TPL 是首个解决多个生成式 AI 视频 depicting 同一动作时同步问题的方法。我们的代码和一个新的多个视频同步数据集已提供,访问地址为 https://bgu-cs-vil.github.io/TPL/。
引用
@article{arxiv.2510.14051,
title = {Synchronization of Multiple Videos},
author = {Avihai Naaman and Ron Shapira Weber and Oren Freifeld},
journal= {arXiv preprint arXiv:2510.14051},
year = {2025}
}
备注
ICCV 2025