中文

面向罗马尼亚医学问答的大规模基准测试

计算与语言 2026-02-13 v4 人工智能 机器学习

摘要

我们介绍MedQARo,即首个面向罗马尼亚医学问答的大规模基准测试,同时对最先进的大型语言模型(LLM)进行全面评估。我们构建了一个由105,880个问答对组成的高质量大规模数据集,这些问答对来自两家医疗机构,涉及1,242名癌症患者的病例摘要,要求进行关键词提取和推理。该基准测试包含原域测试集和跨域(跨中心和跨癌种)测试集,使我们能够精确评估模型的泛化能力。我们在MedQARo上实验了来自不同模型家族的四个开源LLM。每个模型在两种场景下使用:零样本提示和监督式微调。我们还评估了两种通过API提供的先进LLM,分别为GPT-5.2和Gemini 3 Flash。我们的结果表明,微调后的模型显著优于零样本模型,表明预训练模型在MedQARo上难以泛化。我们的发现表明,针对罗马尼亚语临床问答,域特定和语言特定的微调至关重要。

关键词

引用

@article{arxiv.2508.16390,
  title  = {A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian},
  author = {Ana-Cristina Rogoz and Radu Tudor Ionescu and Alexandra-Valentina Anghel and Ionut-Lucian Antone-Iordache and Simona Coniac and Andreea Iuliana Ionescu},
  journal= {arXiv preprint arXiv:2508.16390},
  year   = {2026}
}

备注

Accepted in npj Digital Medicine