中文

基于能量化惊奇建模的第一视角视频无监督注视预测

计算机视觉与模式识别 2021-04-30 v2

摘要

随着沉浸式计算设备的出现,第一视角感知迅速发展。人类注视预测是分析第一视角视频中的一个重要问题,主要通过基于显著性的建模或高度监督的学习来解决。我们定量分析了有监督深度学习模型在未见过的、域外数据上执行第一视角注视预测任务的泛化能力。我们发现其性能高度依赖于训练数据,并局限于训练标注中所指定的领域。在本工作中,我们解决了在不使用任何训练数据的情况下联合预测人类注视点与第一视角视频时间分割的问题。我们引入了一种受认知心理学事件感知模型启发的无监督计算模型。我们利用 Grenander 的模式理论形式体系来表示时空特征,并将惊奇建模为一种预测注视固定点的机制。在两个公开数据集——GTEA 和 GTEA+ 数据集——上的大量评估表明,所提出的模型能够显著优于所有无监督基线以及一些有监督注视预测基线。最后,我们展示了该模型也能以可与更复杂、全监督深度学习基线相媲美的性能对第一视角视频进行时间分割。

关键词

引用

@article{arxiv.2001.11580,
  title  = {Unsupervised Gaze Prediction in Egocentric Videos by Energy-based Surprise Modeling},
  author = {Sathyanarayanan N. Aakur and Arunkumar Bagavathi},
  journal= {arXiv preprint arXiv:2001.11580},
  year   = {2021}
}

备注

To appear at VISAP2021. More details: https://saakur.github.io/Projects/GazePrediction/