检索增强医学问答系统中的偏见评估与缓解
计算与语言
2025-03-28 v3
摘要
基于检索增强生成的医学问答系统因能够整合外部知识而有前景,可用于临床决策支持,从而减少单独使用大语言模型(LLM)时固有的不准确性。然而,这些系统可能无意中传递或放大与种族、性别和社会经济因素等敏感人口属性相关的偏见。本研究系统性地评估了医学 RAG 流水线中基于多个 QA 基准(包括MedQA、MedMCQA、MMLU和EquityMedQA)的民族偏见。我们通过生成和分析具有民族变体的查询,量化检索一致性和答案正确性之间的差异。我们进一步实施并比较了若干偏见缓解策略,包括链式思考推理、反事实过滤、对抗性提示细化和多数投票聚合。实验结果揭示了显著的民族差异,表明多数投票聚合显著改善了准确率和公平性指标。我们的发现凸显了开发真正公平的医学问答系统所需的明确的公平性感知检索方法和提示工程策略的关键性。
引用
@article{arxiv.2503.15454,
title = {Bias Evaluation and Mitigation in Retrieval-Augmented Medical Question-Answering Systems},
author = {Yuelyu Ji and Hang Zhang and Yanshan Wang},
journal= {arXiv preprint arXiv:2503.15454},
year = {2025}
}