MedEBench:诊断文本引导的医学图像编辑的可靠性
计算机视觉与模式识别
2025-10-07 v7 人工智能
摘要
文本引导的图像编辑在自然图像领域取得了显著进展,但其在医学成像中的应用仍然有限,并且缺乏标准化的评估框架。这种编辑可以通过实现个性化手术规划、增强医学教育和改善患者沟通来彻底改变临床实践。为了弥补这一差距,我们引入了 MedEBench1,这是一个旨在诊断文本引导的医学图像编辑可靠性的稳健基准。MedEBench 包含 1,182 对临床策划的图像-提示对,涵盖 70 项不同的编辑任务和 13 个解剖区域。它在三个关键方面做出了贡献:(1)一个基于临床的评估框架,用于衡量编辑准确性、上下文保持和视觉质量,并辅以预期编辑的详细描述和相应的感兴趣区域(ROI)掩码;(2)对七个 SOTA 模型的全面比较,揭示了普遍的失败模式;(3)一种利用注意力对齐的诊断错误分析技术,使用模型注意力图与 ROI 掩码之间的交并比来识别定位错误问题,即模型错误地聚焦于不正确的解剖区域。MedEBench 为开发更可靠、临床上更有效的文本引导医学图像编辑工具奠定了基础。
引用
@article{arxiv.2506.01921,
title = {MedEBench: Diagnosing Reliability in Text-Guided Medical Image Editing},
author = {Minghao Liu and Zhitao He and Zhiyuan Fan and Qingyun Wang and Yi R. Fung},
journal= {arXiv preprint arXiv:2506.01921},
year = {2025}
}
备注
Project website: https://mliuby.github.io/MedEBench_Website/