面向图像描述生成的预训练 CNN 架构
计算机视觉与模式识别
2025-09-29 v1 人工智能
摘要
自动图像描述生成是一项连接计算机视觉和自然语言处理的多层次任务,旨在从视觉输入生成描述性文本内容。虽然卷积神经网络(CNN)和长短期记忆网络(LSTM)取得了显著进展,但存在局限性。循环神经网络的固有序列性质导致训练和推理速度缓慢。LSTM 在处理长序列时进一步难以保留来自早期序列元素的信息。本项目提供构建和理解用于图像描述生成的 Transformer 模型的全面指南。Transformer 采用自注意力机制,捕获数据中的短程和长程依赖关系。这有助于在训练和推理阶段实现高效并行化。我们利用广为人知的 Transformer 架构——在处理序列数据方面效果显著——并提供细致的方法论。利用 Flickr30k 数据集进行数据预处理,构建集成 EfficientNetB0 CNN 用于特征提取的模型架构,并采用注意力机制进行训练。我们的做法体现了利用并行化实现高效训练和推理。项目已发布于 GitHub。
引用
@article{arxiv.2509.17365,
title = {Pre-Trained CNN Architecture for Transformer-Based Image Caption Generation Model},
author = {Amanuel Tafese Dufera},
journal= {arXiv preprint arXiv:2509.17365},
year = {2025}
}