IQAGPT:基于视觉 - 语言模型与 ChatGPT 的图像质量评估
计算机视觉与模式识别
2025-09-01 v1 人工智能
摘要
大型语言模型(LLMs),如 ChatGPT,已在各种任务中展现出令人印象深刻的能力,并作为跨多个领域的自然语言接口引起了越来越多的兴趣。近期,像 BLIP-2 和 GPT-4 这样的大型视觉 - 语言模型(VLMs)得到了深入研究,它们从图像 - 文本对中学习丰富的视觉 - 语言关联。然而,尽管有这些进展,LLMs 和 VLMs 在图像质量评估(IQA)中的应用,特别是在医学成像中的应用,仍有待探索,这对于客观性能评估以及潜在补充甚至替代放射科医生的意见具有重要价值。为此,本文介绍了 IQAGPT,这是一种创新的图像质量评估系统,集成了图像质量描述 VLM 与 ChatGPT,用于生成质量分数和文本报告。首先,我们构建了一个 CT-IQA 数据集用于训练和评估,包含 1,000 张具有不同质量水平且经过专业标注的 CT 切片。为了更好地利用 LLMs 的能力,我们使用提示模板将标注的质量分数转换为语义丰富的文本描述。其次,我们在 CT-IQA 数据集上微调图像质量描述 VLM 以生成质量描述。该描述模型通过跨模态注意力融合图像和文本特征。第三,基于质量描述,用户可以与 ChatGPT 对话以对图像质量进行评分或生成放射学质量报告。我们的初步结果证明了利用大型模型评估图像质量的可行性。值得注意的是,我们的 IQAGPT 优于 GPT-4 和 CLIP-IQA,以及仅依赖图像的多任务分类和回归模型。
引用
@article{arxiv.2312.15663,
title = {IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models},
author = {Zhihao Chen and Bin Hu and Chuang Niu and Tao Chen and Yuxin Li and Hongming Shan and Ge Wang},
journal= {arXiv preprint arXiv:2312.15663},
year = {2025}
}
备注
14 pages, 9 figures