基于模型引导多路径知识聚合的航拍显著性预测
计算机视觉与模式识别
2020-06-09 v2
摘要
作为一种新兴视觉平台,无人机可从许多异常视角观测,这给经典视频显著性预测视觉任务带来诸多新挑战。为研究这些挑战,本文提出一个面向航拍显著性预测的大规模视频数据集,包含 1,000 个航拍视频的真实显著目标区域,由 24 名受试者标注。据我们所知,这是首个专注于无人机视觉显著性预测的大规模视频数据集。基于该数据集,我们提出模型引导多路径网络(MM-Net)作为航拍视频显著性预测的基线模型。受眼动实验标注过程启发,MM-Net 采用多条信息路径,每条路径在经典显著性模型引导下初始化。此后,选择最具代表性路径中编码的视觉显著性知识并聚合,以提升 MM-Net 在航拍场景中预测空间显著性的能力。最后,这些空间预测通过时空优化算法与 temporal 显著性预测自适应结合。实验结果表明,MM-Net 在预测航拍视频显著性方面优于十种最先进模型。
引用
@article{arxiv.1811.05625,
title = {Model-guided Multi-path Knowledge Aggregation for Aerial Saliency Prediction},
author = {Kui Fu and Jia Li and Yu Zhang and Hongze Shen and Yonghong Tian},
journal= {arXiv preprint arXiv:1811.05625},
year = {2020}
}