中文

教育 LLM 巴西医疗:注入官方临床指南知识

计算与语言 2026-05-05 v1

摘要

巴西统一健康系统(SUS)依赖官方临床指南,这些指南定义了超过 2 亿巴西公民的诊断标准、治疗方案、剂量和监测程序。然而,当前的 LLM 在该指南相关知识方面表现不佳,且没有基准评估以巴西葡萄牙语协议为基础的临床记忆。我们弥合了这一差距,通过适配 Qwen2.5-14B-Instruct 至巴西临床领域。从 178 项官方指南(约 540 万 token)中,我们生成约 7000 万 token 的合成数据,包含三种格式——改写版本、wiki 风格文章和问答对,使用四个生成式 LLM。随后应用持续预训练结合群体相对策略优化(GRPO)。我们引入 HealthBench-BR,包含 1780 项平衡的真假临床断言,以及 PCDT-QA,包含 890 题开放式临床问题,由 LLM 评判家打分。我们最佳模型在 HealthBench-BR 上达到 83.9%,在 PCDT-QA 上达到 85.4%,超越 GPT-5.2、Claude Sonnet 4.6、Gemini 3.1 Pro 和 Google AI Overview 的 web 基础 RAG,尽管仅使用 14B 参数。消融实验表明,生成器多样性和强化学习对这些提升至关重要。我们发布所有数据集、基准和模型权重以支持可重复的巴西葡萄牙语临床 NLP 研究。代码、数据和模型权重均可在 https://github.com/hugoabonizio/clinical-protocols-br 获取。

关键词

引用

@article{arxiv.2605.01077,
  title  = {Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines},
  author = {Hugo Abonizio and Filipe Rocha Lopes and Roberto Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2605.01077},
  year   = {2026}
}