Tri-FusionNet:基于Transformer融合网络和双注意力机制增强图像描述生成
计算机视觉与模式识别
2025-04-24 v1
摘要
图像描述生成是无障碍和人工智能理解视觉内容的关键技术。近期深度学习技术在自然语言处理和计算机视觉方面取得了显著进展。本文提出一种新型图像描述生成模型——Tri-FusionNet,其集成了多个Transformer模块:具备双注意力机制的Vision Transformer(ViT)编码器模块、Robustly Optimized BERT Approach(RoBERTa)解码器模块,以及Contrastive Language-Image Pre-Training(CLIP)集成模块。增强双注意力的ViT编码器能够聚焦于相关的空间区域和语言语境,从而提升图像特征提取效果。采用RoBERTa解码器生成精准的文本描述。CLIP集成模块通过对比学习实现视觉与文本数据的对齐,确保两类模态数据的有效融合。该融合ViT、RoBERTa和CLIP的框架,结合双注意力机制,使模型能够生成更准确、语境更丰富且更具灵活性的描述。本文框架在Flickr30k和Flickr8k数据集上实现了竞争性性能,BLEU分数分别为0.767至0.456和0.784至0.479,CIDEr分为1.679和1.483,METEOR分为0.478和0.358,ROUGE-L分为0.567和0.789。在MS-COCO数据集上,本框架获得了B-1为0.893、B-2为0.821、B-3为0.794、B-4为0.725的BLEU分数。结果表明Tri-FusionNet在生成高质量图像描述方面具有有效性。
引用
@article{arxiv.2504.16761,
title = {Tri-FusionNet: Enhancing Image Description Generation with Transformer-based Fusion Network and Dual Attention Mechanism},
author = {Lakshita Agarwal and Bindu Verma},
journal= {arXiv preprint arXiv:2504.16761},
year = {2025}
}