中文

基于 Transformer 图像描述子与跨模型注意力机制的胸部 X 射线高级分析

图像与视频处理 2025-04-24 v1 计算机视觉与模式识别

摘要

胸部 X 射线图像的检查是检测多种胸部疾病的关键组成部分。本研究引入一种新的图像描述生成模型,将 Vision Transformer(ViT)编码器与跨模态注意力以及基于 GPT-4 的转换器解码器相集成。ViT 从胸部 X 射线图像中捕获高质量视觉特征,通过跨模态注意力与文本数据融合,以提高图像描述的准确性、上下文和丰富性。GPT-4 解码器将这些融合特征转化为准确且相关的标题。该模型在 National Institutes of Health(NIH)和 Indiana University(IU)胸部 X 射线数据集上进行测试。在 IU 数据集上,它实现了 0.854(B-1)、0.883(CIDEr)、0.759(METEOR)和 0.712(ROUGE-L)的分数。在 NIH 数据集上,它在所有指标上均实现了最佳性能:BLEU 1--4(0.825、0.788、0.765、0.752)、CIDEr(0.857)、METEOR(0.726)和 ROUGE-L(0.705)。该框架有望提升胸部 X 射线评估,帮助放射科医生实现更精确、更高效的诊断。

关键词

引用

@article{arxiv.2504.16774,
  title  = {Advanced Chest X-Ray Analysis via Transformer-Based Image Descriptors and Cross-Model Attention Mechanism},
  author = {Lakshita Agarwal and Bindu Verma},
  journal= {arXiv preprint arXiv:2504.16774},
  year   = {2025}
}