哪个视角展示得最好?利用语言弱监督多视角教学视频中的视角选择
计算机视觉与模式识别
2025-04-11 v4
摘要
给定一个多视角视频,哪个视角对人类观察者最有信息量?现有方法依赖启发式或昂贵的“最佳视角”监督来回答这个问题,限制了其适用性。我们提出一种弱监督方法,利用伴随教学多视角视频的语言作为恢复其最具信息量视角的手段。我们的核心假设是:单个视角越能准确预测与视角无关的文本摘要,它就越有信息量。为付诸实践,我们提出 LangView 框架,利用视角相关字幕预测的相对准确率作为最佳视角伪标签的代理。然后用这些伪标签训练视角选择器,并辅以增强视角敏感度的相机位姿预测器。推理时,模型仅接收多视角视频——无需语言或相机位姿——并输出每个时间步最佳的观看视角。在两个包含多样化多相机设置和操作类活动的挑战性数据集上,我们的模型在定量指标和人工评估上均持续优于最先进基线。项目页面:https://vision.cs.utexas.edu/projects/which-view-shows-it-best。
引用
@article{arxiv.2411.08753,
title = {Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos},
author = {Sagnik Majumder and Tushar Nagarajan and Ziad Al-Halah and Reina Pradhan and Kristen Grauman},
journal= {arXiv preprint arXiv:2411.08753},
year = {2025}
}
备注
Accepted to CVPR 2025 (Highlight)