中文

PETA:基于 Transformer 注意力的相册事件识别

计算机视觉与模式识别 2021-09-28 v1 机器学习

摘要

近年来,拍摄的个人照片数量显著增加,给多图像理解和高层图像理解带来了新的挑战。个人相册中的事件识别呈现了一个具有挑战性的场景,即需要从包含相关和不相关图像的无序图像集合中识别生活事件。图像中的事件识别也带来了高层图像理解的挑战,这与低层图像目标分类不同。在缺乏分析多输入方法的情况下,以往的方法采用了时间机制,包括各种形式的循环神经网络。然而,它们的有效时间窗口是局部的。此外,鉴于相册的无序特性,它们并不是一个自然的选择。我们通过一个量身定制的解决方案弥补了这一空白,结合 CNN 用于图像表示和 Transformer 用于相册表示的优势,对图像集合进行全局推理,为相册事件识别提供了一个实用且高效的解决方案。我们的解决方案在 3 个主要基准测试上取得了 state-of-the-art 的结果,在所有数据集上的 mAP 均超过 90\%。我们进一步探索了事件识别中相关的图像重要性任务,展示了学习到的注意力如何与这一主观任务的人工标注重要性相关联,从而为新应用打开了大门。

关键词

引用

@article{arxiv.2109.12499,
  title  = {PETA: Photo Albums Event Recognition using Transformers Attention},
  author = {Tamar Glaser and Emanuel Ben-Baruch and Gilad Sharir and Nadav Zamir and Asaf Noy and Lihi Zelnik-Manor},
  journal= {arXiv preprint arXiv:2109.12499},
  year   = {2021}
}

备注

8 pages, 10 including references, 3 figures, was submitted to WACV 2022