中文

基于混合深度学习技术 (CNN+GRU) 的图像描述算法

计算机视觉与模式识别 2023-01-09 v1 人工智能

摘要

基于编码器-解码器框架的图像描述在过去十年中取得了巨大进展,其中 CNN 主要用作编码器,LSTM 用作解码器。尽管在简单图像的准确率方面取得了令人印象深刻的成就,但其在时间复杂度和空间复杂度效率上有所欠缺。此外,对于包含大量信息和物体的复杂图像,由于缺乏图像中所呈现场景的语义理解,这种 CNN-LSTM 组合的性能呈指数级下降。因此,考虑到这些问题,我们提出 CNN-GRU 编码器解码器框架用于描述到图像的重建器,以兼顾语义上下文与时间复杂度。通过考虑解码器的隐藏状态,重建输入图像及其相似的语义表示,并将来自语义重建器的重建分数与似然在模型训练时结合使用,以评估生成描述的质量。因此,解码器获得改进的语义信息,增强了描述生成过程。在模型测试期间,结合重建分数与对数似然也是可行的,以选择最合适的描述。所提模型在时间复杂度和准确率方面优于 SOTA 的 LSTM-A5 图像描述模型。

关键词

引用

@article{arxiv.2301.02440,
  title  = {An Image captioning algorithm based on the Hybrid Deep Learning Technique (CNN+GRU)},
  author = {Rana Adnan Ahmad and Muhammad Azhar and Hina Sattar},
  journal= {arXiv preprint arXiv:2301.02440},
  year   = {2023}
}