中文

IMB:面向意大利语医疗问答的基准数据集

计算与语言 2025-10-22 v1

摘要

在线医疗论坛长期以来一直是患者寻求专业医疗建议的重要平台,产生大量有价值的知识。然而,论坛交互的非正式性质和语言复杂性为自动问答系统带来了重大挑战,尤其是当处理非英语语言时。我们提出两个全面的意大利语医疗基准:IMB-QA 包含 782,644 条来自 77 个医疗类别的患者-医生对话,IMB-MCQA 包含 25,862 条来自医疗专业考试的多选题。我们展示了如何利用大语言模型(LLM)来改善医疗论坛数据的清晰度和一致性,同时保留其原始含义和对话风格,并对比了各种 LLM 架构在开放式和多选问答任务上的表现。我们的实验表明,检索增强生成(RAG)和领域特定微调策略可超过更大规模的通用模型在医疗问答任务中的表现。这些发现表明,有效的医疗 AI 系统可能受益更多来自领域专业知识和高效信息检索,而不是模型规模的增加。我们在 GitHub 仓库中公开这两个数据集和评估框架以支持进一步的研究:https://github.com/PRAISELab-PicusLab/IMB。

关键词

引用

@article{arxiv.2510.18468,
  title  = {IMB: An Italian Medical Benchmark for Question Answering},
  author = {Antonio Romano and Giuseppe Riccio and Mariano Barone and Marco Postiglione and Vincenzo Moscato},
  journal= {arXiv preprint arXiv:2510.18468},
  year   = {2025}
}