中文

基于 CNN- CNN 架构和层次注意力的可解释图像标述

计算机视觉与模式识别 2024-07-16 v1 人工智能

摘要

图像标述是一种为图像生成文本描述的技术。基于特征识别构建的深度学习解决方案可能正好满足这一需求。但像其他任何机器学习解决方案一样,用户对标述生成过程的理解较差,模型未提供其预测的解释,因而常被称为黑箱方法。因此,需要一种方法,使用户能够信任模型的预测,以便更好地理解其工作原理。可解释 AI 是一种方法,通过传统方法来处理,使模型或算法的预测可被解释和论证。因此,本文尝试使用可解释 AI 进行图像标述,以便生成的标述可以被解释和可视化。我们采用一种新的 CNN 解码器和层次注意力概念,以提高标述生成的速度和准确性。此外,将可解释性纳入模型会使其在应用程序中更具可信度。该模型使用 MSCOCO 数据集进行训练和评估,本文 presenting 定量和定性结果。

关键词

引用

@article{arxiv.2407.09556,
  title  = {Explainable Image Captioning using CNN- CNN architecture and Hierarchical Attention},
  author = {Rishi Kesav Mohan and Sanjay Sureshkumar and Vignesh Sivasubramaniam},
  journal= {arXiv preprint arXiv:2407.09556},
  year   = {2024}
}

备注

23 pages,9 figures