中文

超越RNN:基于注意力机制的图像描述生成模型基准测试

计算机视觉与模式识别 2025-02-27 v1 计算与语言

摘要

图像描述生成是计算机视觉与自然语言处理交叉领域的一项具有挑战性的任务,要求模型生成有意义的图像文本描述。传统方法依赖于循环神经网络(RNN),但注意力机制的最新进展已显示出显著的改进。本研究使用MS-COCO数据集,对基于注意力机制的图像描述生成模型与基于RNN的方法进行了性能基准测试。我们评估了Bahdanau注意力在增强图像特征与生成描述之间对齐的有效性。模型使用自然语言处理指标进行评估,如BLEU、METEOR、GLEU和WER。结果表明,基于注意力的模型在生成更准确、语义更丰富的描述方面优于RNN,与人工评估具有更好的一致性。本研究提供了关于注意力机制在图像描述生成中影响的见解,并指出了未来改进的方向。

关键词

引用

@article{arxiv.2502.18734,
  title  = {Beyond RNNs: Benchmarking Attention-Based Image Captioning Models},
  author = {Hemanth Teja Yanambakkam and Rahul Chinthala},
  journal= {arXiv preprint arXiv:2502.18734},
  year   = {2025}
}

备注

10 pages, 6 figures. Code and additional results are available on GitHub under the handle HemanthTejaY