统一动态扫描路径预测器优于单独训练的神经模型
计算机视觉与模式识别
2025-04-22 v3 人工智能
摘要
先前关于扫描路径预测的研究主要集中在群体模型上,忽略了不同个体的扫描路径和注意力行为存在差异这一事实。忽视这些差异对社会性人机交互尤其不利,因为机器人通常基于启发式规则或预定义模式来模拟人类注视。然而,人类注视模式是异质的,不同的行为会显著影响这种人机交互的结果。为了填补这一空白,我们开发了一个基于深度学习的社会线索整合模型,用于显著性预测,进而预测视频中的扫描路径。我们的模型通过门控机制和顺序注意力递归地整合注视历史和社会线索来学习扫描路径。我们在自由观看条件下观察的动态社会场景注视数据集上评估了我们的方法。将注视历史引入我们的模型使得训练单个统一模型成为可能,而不是为每组扫描路径训练单独模型这种资源密集型方法。我们观察到,与分布相似但规模较小的数据集相比,在大数据集上训练模型时,晚期神经整合方法优于早期融合。结果还表明,一个在所有观察者的扫描路径上训练的统一模型,其表现与单独训练的模型相当或更好。我们假设,这一结果是因为群体显著性表示在模型中注入了普遍注意力,而监督信号和注视历史引导模型学习个性化注意力行为,使得统一模型因其对普遍注意力的隐式表示而比单独模型更具优势。
引用
@article{arxiv.2405.02929,
title = {Unified Dynamic Scanpath Predictors Outperform Individually Trained Neural Models},
author = {Fares Abawi and Di Fu and Stefan Wermter},
journal= {arXiv preprint arXiv:2405.02929},
year = {2025}
}