中文

多语言医学推理问答大语言模型

计算与语言 2026-03-31 v2 人工智能

摘要

大型语言模型 (LLM) 具备推理能力,近期在医学问答 (QA) 中显示出强大的潜力。现有方法主要以英语为中心,主要依赖从通用 LLM 蒸馏,引发对医学知识可靠性的担忧。本文提出一种方法,基于从 Wikipedia 提取的医学知识生成多语言推理痕迹。我们生成 50 万 English、意大利语和西班牙语推理痕迹,采用基于医学信息的检索增强生成方法。这些痕迹用于解决从 MedQA 和 MedMCQA 中抽取的医学问题,我们将其扩展至意大利语和西班牙语。我们在 Medical QA 基准测试的 in-domain 和 out-of-domain 设置中测试了该管道,证明这些推理痕迹在通过 in-context learning (few-shot) 和监督微调两种方式利用时,均能提升性能,达到 8B 参数 LLM 中的最先进水平。我们认为这些资源可以支持开发更透明的多语言临床决策支持工具。我们公开了完整的资源套件:推理痕迹、翻译后的 QA 数据集、Medical-Wikipedia 以及微调模型。

关键词

引用

@article{arxiv.2512.05658,
  title  = {Multilingual Medical Reasoning for Question Answering with Large Language Models},
  author = {Pietro Ferrazzi and Aitor Soroa and Rodrigo Agerri},
  journal= {arXiv preprint arXiv:2512.05658},
  year   = {2026}
}

备注

Under Review