从嵌入到诊断:临床 LLM 在智能体扰动下的潜在脆弱性
机器学习
2025-07-30 v1 人工智能
摘要
用于临床决策支持的 LLM 在静态基准测试上表现优异,但在掩蔽某个症状或否定某个发现等微小却具有临床意义的输入变化下往往会失效。这些推理失败通常无法被标准 NLP 指标检测到,因为标准 NLP 指标对驱动诊断不稳定性的潜在表征变化不敏感。我们提出了一种几何感知评估框架 LAPD(Latent Agentic Perturbation Diagnostics,潜在智能体扰动诊断),该框架在结构化对抗编辑下系统地探测临床 LLM 的潜在鲁棒性。在该框架内,我们引入了潜在诊断翻转率(Latent Diagnosis Flip Rate, LDFR),这是一种与模型无关的诊断信号,用于捕捉当嵌入在 PCA 降维后的潜在空间中跨越决策边界时的表征不稳定性。临床记录通过一个基于诊断推理的结构化提示流水线生成,随后沿四个轴进行扰动:掩蔽、否定、同义词替换和数值变化,以模拟常见的歧义与遗漏。我们在基础 LLM 和临床 LLM 上计算了 LDFR,发现即使在最小表层变化下也会出现潜在脆弱性。最后,我们在来自 DiReCT 基准(MIMIC-IV)的 90 份真实临床记录上验证了我们的发现,证实了 LDFR 在合成环境之外的泛化能力。我们的结果揭示了表层鲁棒性与语义稳定性之间持续存在的差距,凸显了在安全攸关的临床 AI 中进行几何感知审计的重要性。
引用
@article{arxiv.2507.21188,
title = {Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs},
author = {Raj Krishnan Vijayaraj},
journal= {arXiv preprint arXiv:2507.21188},
year = {2025}
}