中文

从嵌入到诊断:临床 LLM 在代理性扰动下的潜在脆弱性

社会与信息网络 2025-07-30 v1

摘要

临床决策支持的 LLM 在面对如掩盖症状或否定发现等小幅但临床意义的输入偏移时常常难以保持稳健性,尽管在静态基准测试上表现良好。这些推理失效经常未被标准 NLP 指标检测到,因为后者对驱动诊断不稳定性的潜在表示偏移不敏感。我们提出了几何感知的评估框架 LAPD(Latent Agentic Perturbation Diagnostics),系统性地探测临床 LLM 在结构化对抗性编辑下的潜在鲁棒性。在此框架内,我们引入了潜在诊断翻转率(LDFR),这是一种模型中性的诊断信号,捕捉当嵌入跨越 PCA 降维潜在空间中的决策边界时的表示不稳定性。我们使用基于诊断推理的结构化提示管道生成临床报告,然后沿四个轴线进行扰动:掩盖、否定、同义替换和数值变异,以模拟常见的歧义和遗漏。我们计算了基础模型和临床 LLM 上的 LDFR,发现即使在表面级变化最小的情况下,潜在脆弱性也会显现。最后,我们在 DiReCT 基准(MIMIC-IV)上的 90 份真实临床报告中验证了 LDFR 的可推广性。我们的结果揭示了表面鲁棒性与语义稳定性之间的持久差距,凸显了在安全关键临床 AI 领域几何感知审计的重要性。

关键词

引用

@article{arxiv.2507.21187,
  title  = {Half-life of Youtube News Videos: Diffusion Dynamics and Predictive Factors},
  author = {Anahit Sargsyan and Hridoy Sankar Dutta and Juergen Pfeffer},
  journal= {arXiv preprint arXiv:2507.21187},
  year   = {2025}
}

备注

To be published in International Conference on Machine Learning, Optimization, and Data Science (LOD 2025)