中文

揭示医学大语言模型中细粒度偏见的路径

人工智能 2025-12-23 v2

摘要

用于医疗应用的大语言模型(Large Language Models,LLMs)已知容易表现出偏见和不公平的模式。在将其部署于临床决策之前,关键的是识别这些偏见模式以实现有效的缓解并最小化负面影响。本研究提出了一种新型框架,将知识图谱(Knowledge Graphs,KGs)与辅助(agentic)大语言模型相结合,以系统性地揭示医学大语言模型中复杂的偏见模式。该方法整合了对抗性扰动(red teaming)技术,以识别细微的偏见模式,并采用定制的多跳知识图谱表征以增强对目标大语言模型的系统性评估。该方法旨不仅生成更有效的偏见评估红队问题,还能更有效地利用这些问题来揭示复杂的偏见。通过在三个数据集、六个大语言模型和五种偏见类型上的系列全面实验,我们展示了本文提出的框架在揭示医学大语言模型中复杂偏见模式方面,相较于其他常见方法具有显著更大的能力和可扩展性。

关键词

引用

@article{arxiv.2507.21176,
  title  = {Toward Revealing Nuanced Biases in Medical LLMs},
  author = {Farzana Islam Adiba and Rahmatollah Beheshti},
  journal= {arXiv preprint arXiv:2507.21176},
  year   = {2025}
}