基于共享表示的统一注意力建模以实现高效自由观看与视觉搜索
计算机视觉与模式识别
2025-06-04 v1 人工智能
摘要
自由观看和特定任务设置中的计算人类注意力建模通常被分开研究,对它们之间是否存在共同表示的探索有限。本工作研究了这个问题,并提出了一种基于人类注意力 Transformer 的神经网络架构来检验这一假设。我们的结果表明,自由观看和视觉搜索可以有效地共享一个共同表示,允许在自由观看注意力上训练的模型将其知识迁移到任务驱动的视觉搜索中,在预测注视扫描路径上仅有 3.86% 的性能下降(通过语义序列得分指标测量,该指标反映了预测扫描路径与人类扫描路径之间的相似度)。这种迁移在 GFLOPs 方面减少了 92.29% 的计算成本,在可训练参数方面减少了 31.23%。
引用
@article{arxiv.2506.02764,
title = {Unified Attention Modeling for Efficient Free-Viewing and Visual Search via Shared Representations},
author = {Fatma Youssef Mohammed and Kostas Alexis},
journal= {arXiv preprint arXiv:2506.02764},
year = {2025}
}
备注
Accepted to the 2025 IEEE International Conference on Development and Learning (ICDL)