中文

视觉-语言模型中抽象的度量与对齐:结合医学分类体系

人工智能 2026-01-22 v1

摘要

视觉-语言模型在胸部 X 射线分类中表现出强大的零样本性能,但标准的扁平化指标无法区分临床上轻微和严重的错误。本研究探讨了如何利用医学分类体系来量化和缓解抽象错误。我们使用分层指标对几个最先进的 VLM 进行了基准测试,并引入了灾难性抽象误差来捕获跨分支错误。我们的结果显示,尽管 VLM 具有很高的扁平化性能,但与临床分类体系存在显著错位。为了解决这个问题,我们提出了风险约束阈值化和具有径向嵌入的分类体系感知微调,这将严重抽象错误减少到 2% 以下,同时保持了有竞争力的性能。这些发现突出了分层评估和表示层面对齐对于更安全、更具临床意义的 VLM 部署的重要性。

关键词

引用

@article{arxiv.2601.14827,
  title  = {Measuring and Aligning Abstraction in Vision-Language Models with Medical Taxonomies},
  author = {Ben Schaper and Maxime Di Folco and Bernhard Kainz and Julia A. Schnabel and Cosmin I. Bercea},
  journal= {arXiv preprint arXiv:2601.14827},
  year   = {2026}
}