噪声感知的视频显著性预测
计算机视觉与模式识别
2021-11-23 v2 机器学习
摘要
我们解决了动态场景视频的显著性图预测问题。我们注意到,由固定数量观察者注视数据重建的显著性图的精度随帧变化,因为这取决于场景内容。当可用观察者数量有限时,这一问题尤为紧迫。在此类情况下,像传统深度学习方法那样直接最小化预测显著性图与实测显著性图之间的差异,会导致对噪声数据的过拟合。我们提出了一种噪声感知训练(NAT)范式,该范式量化并考虑了由帧特定注视数据不准确性引起的不确定性。我们表明,在可用训练数据有限时,NAT 尤其具有优势,并在不同模型、损失函数和数据集上进行了实验。我们还引入了一个基于视频游戏的显著性数据集,其具有丰富的时序语义,且每帧包含多个注视吸引点。数据集与源代码可在 https://github.com/NVlabs/NAT-saliency 获取。
引用
@article{arxiv.2104.08038,
title = {Noise-Aware Video Saliency Prediction},
author = {Ekta Prashnani and Orazio Gallo and Joohwan Kim and Josef Spjut and Pradeep Sen and Iuri Frosio},
journal= {arXiv preprint arXiv:2104.08038},
year = {2021}
}
备注
10 pages, 3 figures, 7 tables