中文

显著性感知的自动佛像识别

计算机视觉与模式识别 2024-02-28 v1

摘要

佛像作为多种宗教的象征,具有重要的文化内涵,对于理解不同地区的文化和历史至关重要,因此佛像识别是佛学研究领域的关键环节。然而,佛像识别需要知识渊博的专业人员投入大量时间和精力,使其成为一项成本高昂的任务。卷积神经网络(CNN)在处理视觉信息方面 inherently 高效,但当面临类别不平衡问题时,仅靠 CNN 可能会做出不准确的分类决策。因此,本文提出了一种基于显著图采样的端到端自动佛像识别模型。所提出的网格级局部自注意力模块(GLSA)提供了额外的显著特征,可用于丰富数据集,并使 CNN 能够以更全面的方式进行观察。最终,我们的模型在佛像专家协助收集的佛像数据集上进行了评估,其 Top-1 准确率平均比最先进网络高出 4.63%,而 MUL-ADD 仅略有增加。

关键词

引用

@article{arxiv.2402.16980,
  title  = {Saliency-Aware Automatic Buddhas Statue Recognition},
  author = {Yong Qi and Fanghan Zhao},
  journal= {arXiv preprint arXiv:2402.16980},
  year   = {2024}
}