SafeMed-R1:针对医学视觉语言模型的对抗强化学习
人工智能
2025-12-23 v1
摘要
视觉语言模型(VLM)在医学视觉问答(VQA)中展现出巨大潜力,但因高度易受对抗攻击而难以在临床环境中部署。标准对抗训练虽对简单任务有效,但常会降低泛化性能和临床推理质量。我们引入SafeMed-R1,一种混合防御框架,确保稳健性能的同时保持高质量、可解释的医学推理。SafeMed-R1采用两阶段方法:训练阶段集成对抗训练与群体相对策略优化(AT-GRPO),以显式鲁棒化推理过程以抵抗最坏情况扰动;推理阶段增强模型时使用随机平滑,提供认证的L2范数鲁棒性保证。在OmniMedVQA基准测试中评估了SafeMed-R1,涵盖八种医学成像模态,样本超过88,000个。实验结果表明,标准微调的VLM尽管在干净输入上达到95%准确率,但在PGD攻击下精度骤降至约25%;而SafeMed-R1在相同对抗条件下保持84.45%准确率,鲁棒性提升约59个百分点。此外,我们还证明,采用显式链式思考推理的模型在对抗鲁棒性方面优于仅指令变体,这表明医学AI系统中可解释性与安全性之间存在协同效应。
引用
@article{arxiv.2512.19317,
title = {SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models},
author = {A. A. Gde Yogi Pramana and Jason Ray and Anthony Jaya and Michael Wijaya},
journal= {arXiv preprint arXiv:2512.19317},
year = {2025}
}