中文

PerMedCQA:波斯语医学消费者问答基准

计算与语言 2025-05-27 v1 人工智能

摘要

医学消费者问答(CQA)对于通过提供个性化可靠健康信息来赋能患者至关重要。尽管近期在大型语言模型(LLM)上取得了医学问答方面的进展,但针对消费者导向和多语言资源,特别是波斯语等低资源语言,仍显稀缺。为弥合这一差距,我们提出PerMedCQA,这是第一个针对波斯语语言大型语言模型进行真实世界消费者生成医学问题评估的基准数据集。该数据集源自大型医学问答论坛,包含68,138个问答对,通过严格清洗自最初的87,780条原始条目后得出。我们评估了多个最新多语言和指令调优型LLM,采用MedJudge——一种由LLM评估器驱动的新型基于评分表的评估框架,并与专家人工标注员验证。我们的结果揭示了多语言医学问答中的关键挑战,并为开发更准确和上下文感知的医学辅助系统提供了宝贵洞见。该数据集已公开发布于https://huggingface.co/datasets/NaghmehAI/PerMedCQA

关键词

引用

@article{arxiv.2505.18331,
  title  = {PerMedCQA: Benchmarking Large Language Models on Medical Consumer Question Answering in Persian Language},
  author = {Naghmeh Jamali and Milad Mohammadi and Danial Baledi and Zahra Rezvani and Hesham Faili},
  journal= {arXiv preprint arXiv:2505.18331},
  year   = {2025}
}