面向文本驱动医学图像合成的病理感知自适应水印
计算机视觉与模式识别
2025-09-03 v2
摘要
随着近期文本条件扩散模型能够生成高质量图像,对其潜在滥用的担忧也日益增加。这一问题在医学领域尤为关键,因为文本条件生成的医学图像可能导致保险欺诈或伪造记录,凸显了针对不道德使用建立可靠保障措施的迫切需求。尽管水印技术已成为通用图像领域中一种极具前景的解决方案,但将其直接应用于医学成像仍面临重大挑战。一个关键挑战在于保留细粒度的疾病表征,因为水印带来的轻微失真都可能导致临床误判,从而损害诊断的完整性。为了弥补这一不足,我们提出了 MedSign,这是一个专门为文本到医学图像合成设计的基于深度学习的水印框架,它通过自适应调整水印强度来保留具有病理意义的区域。具体而言,我们利用医学文本 token 与扩散去噪网络之间的交叉注意力生成病理定位图,并聚合跨网络层、注意力头和时间步的 token 级注意力。利用该图,我们优化 LDM 解码器以在图像合成过程中嵌入水印,确保其无缝整合,同时将对诊断关键区域的干扰降至最低。实验结果表明,我们的 MedSign 在保证水印鲁棒性的同时保留了诊断完整性,在 MIMIC-CXR 和 OIA-ODIR 数据集上的图像质量和检测精度均达到了 SOTA 性能。
引用
@article{arxiv.2503.08346,
title = {Pathology-Aware Adaptive Watermarking for Text-Driven Medical Image Synthesis},
author = {Chanyoung Kim and Dayun Ju and Jinyeong Kim and Woojung Han and Roberto Alcover-Couso and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2503.08346},
year = {2025}
}