中文

哪个视角展示得最好?利用语言弱监督多视角教学视频中的视角选择

计算机视觉与模式识别 2025-04-11 v4

摘要

给定一个多视角视频,哪个视角对人类观察者最有信息量?现有方法依赖启发式或昂贵的“最佳视角”监督来回答这个问题,限制了其适用性。我们提出一种弱监督方法,利用伴随教学多视角视频的语言作为恢复其最具信息量视角的手段。我们的核心假设是:单个视角越能准确预测与视角无关的文本摘要,它就越有信息量。为付诸实践,我们提出 LangView 框架,利用视角相关字幕预测的相对准确率作为最佳视角伪标签的代理。然后用这些伪标签训练视角选择器,并辅以增强视角敏感度的相机位姿预测器。推理时,模型仅接收多视角视频——无需语言或相机位姿——并输出每个时间步最佳的观看视角。在两个包含多样化多相机设置和操作类活动的挑战性数据集上,我们的模型在定量指标和人工评估上均持续优于最先进基线。项目页面:https://vision.cs.utexas.edu/projects/which-view-shows-it-best。

关键词

引用

@article{arxiv.2411.08753,
  title  = {Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos},
  author = {Sagnik Majumder and Tushar Nagarajan and Ziad Al-Halah and Reina Pradhan and Kristen Grauman},
  journal= {arXiv preprint arXiv:2411.08753},
  year   = {2025}
}

备注

Accepted to CVPR 2025 (Highlight)