中文

MORQA:医学开放式问答评估指标基准测试

计算与语言 2025-09-17 v1

摘要

由于对准确性、相关性和领域专业知识的极高要求,在医学领域评估自然语言生成(NLG)系统面临着独特的挑战。传统的自动评估指标,如 BLEU、ROUGE 和 BERTScore,往往难以区分高质量输出,尤其是在医学问答(QA)任务具有开放式特征且可能存在多个有效回答的情况下。在本工作中,我们引入了 MORQA(Medical Open-Response QA),这是一个新的多语言基准,旨在评估 NLG 评估指标在三个英文和中文医学视觉与文本问答数据集上的有效性。与现有资源不同,我们的数据集包含由医学专业人员编写的 2-4 个以上的标准答案,以及针对三个英文和中文子集的专家人工评分。我们对传统指标和基于大语言模型(LLM)的评估器(如 GPT-4 和 Gemini)进行了基准测试,发现基于 LLM 的方法在与专家判断的相关性方面显著优于传统指标。我们进一步分析了推动这一改进的因素,包括 LLM 对语义细微差别的敏感性和对参考答案变异性的鲁棒性。我们的结果提供了医学领域 NLG 评估的首个全面的多语言定性研究,突出了对符合人类认知的评估方法的需求。所有数据集和标注将公开发布以支持未来的研究。

关键词

引用

@article{arxiv.2509.12405,
  title  = {MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering},
  author = {Wen-wai Yim and Asma Ben Abacha and Zixuan Yu and Robert Doerning and Fei Xia and Meliha Yetisgen},
  journal= {arXiv preprint arXiv:2509.12405},
  year   = {2025}
}

备注

9 pages, 8 tables