循环视觉-语言操纵器:面向自动化报告生成的可靠且细粒度的图像解释
计算机视觉与模式识别
2025-06-23 v3 人工智能
计算与语言
机器学习
摘要
尽管自动报告生成取得了显著进展,但文本可解释性的不透明性继续对所生成内容的可靠性产生质疑。本文提出了一种新方法,用于识别影响报告生成模型输出的 X 射线图像中的特定图像特征。具体而言,我们提出了循环视觉-语言操纵器 CVLM,这是一个模块,用于从原始 X 射线图像和指定报告生成器生成报告来生成操纵后的 X 射线图像。CVLM 的核心在于,将操纵后的 X 射线图像循环输入报告生成器会产生与预先注入到 X 射线生成报告中的修改相一致的修改后报告,从而实现"循环操纵"这一术语。这一过程允许直接比较原始和操纵后的 X 射线图像,阐明驱动报告变化的关键图像特征,并使模型用户能够评估生成文本的可靠性。实证评估表明,CVLM 能够识别出比现有解释方法更精确、更可靠的特征,显著增强了 AI 生成报告的透明度和适用性。
引用
@article{arxiv.2411.05261,
title = {Cyclic Vision-Language Manipulator: Towards Reliable and Fine-Grained Image Interpretation for Automated Report Generation},
author = {Yingying Fang and Zihao Jin and Shaojie Guo and Jinda Liu and Zhiling Yue and Yijian Gao and Junzhi Ning and Zhi Li and Simon Walsh and Guang Yang},
journal= {arXiv preprint arXiv:2411.05261},
year = {2025}
}