中文

BLUEmed:用于临床错误检测的检索增强多智能体辩论框架

计算与语言 2026-04-14 v1

摘要

临床记录中的术语替换错误,即一个医学术语被一个语言上有效但临床上不同的术语所替代,对医疗保健领域的自动化错误检测构成了持久的挑战。我们引入了 BLUEmed,一个融合了混合检索增强生成(RAG)的多智能体辩论框架,它将基于证据的推理与多视角验证相结合,用于临床错误检测。BLUEmed 将每份临床记录分解为聚焦的子查询,通过稠密、稀疏和在线检索获取源分区证据,并指派两个领域专家智能体使用不同的知识库来产生独立分析;当专家意见不一致时,通过结构化的反驳轮次和跨源裁决来解决冲突,随后由一个级联安全层过滤常见的假阳性模式。我们在零样本和少样本提示设置下,使用涵盖闭源和开源系列的多个骨干模型,在一个临床术语替换检测基准上评估了 BLUEmed。实验结果表明,在少样本提示下,BLUEmed 取得了最佳的准确率(69.13%)、ROC-AUC(74.45%)和 PR-AUC(72.44%),优于单智能体 RAG 和仅辩论的基线。跨六个骨干模型和两种提示策略的进一步分析证实,检索增强和结构化辩论是互补的,并且该框架从具有足够指令遵循和临床语言理解能力的模型中获益最多。

关键词

引用

@article{arxiv.2604.10389,
  title  = {BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection},
  author = {Saukun Thika You and Nguyen Anh Khoa Tran and Wesley K. Marizane and Hanshu Rao and Qiunan Zhang and Xiaolei Huang},
  journal= {arXiv preprint arXiv:2604.10389},
  year   = {2026}
}

备注

Accepted to the IEEE International Conference on Healthcare Informatics (ICHI) 2026