MDS-ViTNet:利用Vision Transformer改进眼动追踪的显著性预测
计算机视觉与模式识别
2024-05-31 v1 人工智能
摘要
在本文中,我们提出了一种称为MDS-ViTNet(多解码器显著性Vision Transformer网络)的新方法,用于增强视觉显著性预测或眼动追踪。该方法在营销、医学、机器人和零售等多个领域具有重要潜力。我们提出了一种利用Vision Transformer的网络架构,超越了传统的ImageNet主干网络。该框架采用编码器-解码器结构,编码器使用Swin Transformer高效嵌入最重要的特征。该过程涉及迁移学习方法,其中Vision Transformer的层由编码器Transformer转换并无缝集成到CNN解码器中。该方法确保了原始输入图像的信息损失最小化。解码器采用多解码技术,利用双解码器生成两个不同的注意力图,随后通过额外的CNN模型合并为单一输出。我们训练的模型MDS-ViTNet在多个基准测试中达到了最先进的结果。为促进进一步合作,我们计划公开代码、模型和数据集。
引用
@article{arxiv.2405.19501,
title = {MDS-ViTNet: Improving saliency prediction for Eye-Tracking with Vision Transformer},
author = {Polezhaev Ignat and Goncharenko Igor and Iurina Natalya},
journal= {arXiv preprint arXiv:2405.19501},
year = {2024}
}