语义预测:识别与预测孰先孰后?
计算机视觉与模式识别
2021-10-07 v1
摘要
视频预测的最终目标并非在给定若干先前帧的情况下预测未来像素值。相反,视频预测的最终目标是以自监督方式从大量可用无标签视频数据中发现有价值的内在表示,以用于下游任务。主要下游任务之一是解释场景的语义构成并将其用于决策。例如,通过预测人体运动,观察者可以预期人类活动并在共享工作空间中协作。给定预训练的视频预测模型和预训练的语义提取模型,有两种主要方式实现相同结果:可以先应用预测然后提取语义,或者先提取语义然后预测。我们使用局部频域Transformer网络(LFDTN)作为视频预测模型、U-Net作为语义提取模型,在合成与真实数据集上研究了这些配置。
引用
@article{arxiv.2110.02829,
title = {Semantic Prediction: Which One Should Come First, Recognition or Prediction?},
author = {Hafez Farazi and Jan Nogga and and Sven Behnke},
journal= {arXiv preprint arXiv:2110.02829},
year = {2021}
}