从注视点学习显著性
计算机视觉与模式识别
2023-11-27 v1 人工智能
摘要
我们提出了一种用于图像显著性预测的新方法,利用transformers中的并行解码,仅从注视图学习显著性。模型通常依赖连续显著性图,以克服离散注视图优化困难的问题。我们尝试复现生成显著性数据集的实验设置。我们的方法将显著性预测视为一个直接的集合预测问题,通过全局损失在二部匹配下强制唯一注视预测,并采用transformer编码器-解码器架构。通过使用一组固定的已学习注视查询,交叉注意力对图像特征进行推理以直接输出注视点,这使其区别于其他现代显著性预测器。我们的方法名为Saliency TRansformer(SalTR),在Salicon与MIT300基准上取得了与最先进方法相当的度量分数。
引用
@article{arxiv.2311.14073,
title = {Learning Saliency From Fixations},
author = {Yasser Abdelaziz Dahou Djilali and Kevin McGuiness and Noel O'Connor},
journal= {arXiv preprint arXiv:2311.14073},
year = {2023}
}