Switch-a-View:从无标签野外视频中学习视角选择
计算机视觉与模式识别
2025-04-23 v3
摘要
我们提出了 SWITCH-A-VIEW 模型,可在创建如何制作视频时自动选择每个时间点的显示视角。我们方法的关键洞察在于如何从无标签但人类编辑的视频样本中进行训练。我们提出了一个预文本任务,对训练视频的片段进行伪标签,以确定其主要视角(如体部视角或外侧视角),然后发现如何制作视频中视觉内容和语言内容之间的模式,以及视角切换时刻之间的关系。凭借这个预测器,我们的模型可以应用于新的多视角视频设置,用于协调在何时显示哪个视角,即使该设置带有有限标签。我们在来自 HowTo100M 和 Ego-Exo4D 的各种真实世界视频上演示了我们的想法,并严格验证了其优势。
引用
@article{arxiv.2412.18386,
title = {Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos},
author = {Sagnik Majumder and Tushar Nagarajan and Ziad Al-Halah and Kristen Grauman},
journal= {arXiv preprint arXiv:2412.18386},
year = {2025}
}