中文

CRAFT:面向医学图像合成的临床奖励对齐微调

计算机视觉与模式识别 2026-05-14 v1

摘要

基础扩散模型能够生成逼真的自然图像,但将其应用于医学成像仍存在挑战。在医学适应过程中,受限的标注数据会加剧类似幻觉和临床不合理的合成现象,而现有指标如 FID 或 Inception Score 无法量化单张图像与病灶相关标准的对齐程度。我们提出了临床对齐评分(Clinical Alignment Score, CAS),这是一种基于基础模型的临床对齐代理评估指标,其评估维度超越了视觉保真度。在 CAS 基础上,我们提出了临床奖励对齐微调(Clinical Reward-Aligned Finetuning, CRAFT),这是一种通过标签条件化提示丰富、临床检查清单和可微奖励优化,将医学知识从多模态大语言模型和视觉语言模型迁移到适应框架的奖励式方法。在四种多样化模态上,CRAFT 在 CAS 和下游分类性能上均优于强大的适应基线。除平均 CAS 提升外,CRAFT 将经验低对齐尾部降低至真实图像参考阈值以下,相对于最强基线降低 5.5-34.7 个百分点,对应数据集间的平均相对降低 20.4%。这些结果表明在 CAS 下的生成图像更少出现类似幻觉的现象,经由跨家族评估器评估、结构检查清单审计、记忆分析以及在 CheXpert 上的盲法医生偏好研究予以证实。

关键词

引用

@article{arxiv.2605.12650,
  title  = {CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis},
  author = {Yunsung Chung and Alex El Darzi and Carlo El Khoury and Han Feng and Nassir Marrouche and Jihun Hamm},
  journal= {arXiv preprint arXiv:2605.12650},
  year   = {2026}
}