中文

视觉令牌遮蔽无法防止医学文档OCR中的PHI泄露:系统性评估

计算机视觉与模式识别 2025-11-25 v1 密码学与安全

摘要

大型视觉语言模型(VLM)日益用于医疗保健领域的光学字符识别(OCR),引发对文档处理期间受保护健康信息(PHI)暴露的严重关切。本工作对推理时视觉令牌遮蔽作为医学文档OCR的隐私保护机制进行首次系统评估。我们引入七种遮蔽策略(V3-V9),针对不同架构层级(SAM编码器块、压缩层、双视觉编码器、投影层融合),评估不同HIPAA定义类别下的PHI降低情况。我们使用100份合成医疗账单进行测试(该账单源自38,517份标注文档的语料库,拥有完美的ground-truth标注)。所有遮蔽策略均收敛至42.9%的PHI降低,成功抑制了长格式空间分布标识符(患者姓名、出生日期、物理地址)100%的效果,但未能防止短结构标识符(医疗记录号、社会安全号码、电子邮件地址、账户号码)的0%降低。 varying mask expansion radius(r=1,2,3)的消融研究表明,增加空间覆盖范围无法超越此瓶颈提升降低效果,表明是语言模型的上下文推理——而非视觉遮蔽不足——驱动结构标识符泄露。模拟的混合架构结合视觉遮蔽与NLP后处理实现了88.6%的总PHI降低(假设NLP对剩余标识符准确率为80%)。本项负结果确立了视觉级隐私干预在VLM中的边界,提供了区分不同PHI类型适合视觉层级与语言层级红acted的指导,并引导未来研究向解码器级微调和混合防御深度架构方向发展,以实现HIPAA合规的医疗文档处理。

关键词

引用

@article{arxiv.2511.18272,
  title  = {Vision Token Masking Alone Cannot Prevent PHI Leakage in Medical Document OCR: A Systematic Evaluation},
  author = {Richard J. Young},
  journal= {arXiv preprint arXiv:2511.18272},
  year   = {2025}
}

备注

24 pages, 11 figures, 2 tables