行人场景中基于上下文增强的视觉注意预测
计算机视觉与模式识别
2022-11-01 v1
摘要
有效且灵活的视觉注意分配,对于须在不同紧迫度与安全偏好条件下导航至期望目标的行人而言至关重要。尽管行人注意的自动建模在改进行人行为仿真方面大有前景,当前的显著性预测方法多聚焦于通用自由观看场景,并未反映行人注意预测中的特定挑战。本文提出Context-SalNET,一种新颖的编码器-解码器架构,显式应对行人视觉注意预测的三个关键挑战:第一,Context-SalNET在编码器-解码器模型的潜空间中显式建模紧迫度与安全偏好等上下文因素。第二,我们提出指数加权均方误差损失(ew-MSE),能更好地应对真值显著性图中仅一小部分含非零项这一事实。第三,我们显式建模认知不确定性,以解释行人注意预测训练数据有限的情况。为评估Context-SalNET,我们记录了首个VR中行人视觉注意数据集,其显式包含了紧迫度与安全偏好等上下文因素的变化。Context-SalNET相较最先进显著性预测方法以及各消融版本均取得明显改进。我们的新颖数据集将完全公开,可作为行人注意预测进一步研究的宝贵资源。
引用
@article{arxiv.2210.16933,
title = {Context-empowered Visual Attention Prediction in Pedestrian Scenarios},
author = {Igor Vozniak and Philipp Mueller and Lorena Hell and Nils Lipp and Ahmed Abouelazm and Christian Mueller},
journal= {arXiv preprint arXiv:2210.16933},
year = {2022}
}