Visual Sync:基于跨视角物体运动的多摄像机同步
计算机视觉与模式识别
2025-12-02 v1 人工智能
机器学习
机器人学
摘要
如今,人们可以轻松地使用多个消费级摄像机记录值得纪念的瞬间,范围从演唱会、体育赛事、讲座、家庭聚会到生日派对。然而,对这些跨摄像机流媒体进行同步仍然具有挑战性。现有方法假设受控环境、特定目标、手动校正或高成本硬件。我们提出VisualSync,一个基于多视角动力学的优化框架,用于在毫秒级精度下对未定位、未同步的视频进行对齐。我们的关键洞察是:任何运动的 3D 点当正确同步后,在两个摄像机中可见时,都遵循极线约束。为此,VisualSync 利用即插即用 3D 重建、特征匹配和稠密跟踪来提取轨迹、相对姿态和跨视角对应关系。随后,它联合最小化极线误差以估计每个摄像机的时间偏移。在四个多样化且具有挑战性的数据集上进行实验,显示VisualSync 优于基线方法,在中位数同步误差下低于 50 毫秒。
引用
@article{arxiv.2512.02017,
title = {Visual Sync: Multi-Camera Synchronization via Cross-View Object Motion},
author = {Shaowei Liu and David Yifan Yao and Saurabh Gupta and Shenlong Wang},
journal= {arXiv preprint arXiv:2512.02017},
year = {2025}
}
备注
Accepted to NeurIPS 2025. Project page: https://stevenlsw.github.io/visualsync/