中文

ClinIQLink 2025 医学问答共享任务综述

计算与语言 2025-06-30 v1 人工智能 信息检索

摘要

在本文中,我们介绍了ClinIQLink共享任务的概况。该任务与ACL 2025的第24届BioNLP研讨会同期举办,旨在针对全科医生水平的医学导向问答,对大语言模型(LLM)进行压力测试。该挑战提供了4,978个经专家验证、有医学来源依据的问答对,涵盖七种格式:真/假、多项选择、无序列表、简答、简答逆序、多跳和多跳逆序。参赛系统被打包成Docker或Apptainer镜像,在CodaBench平台或马里兰大学的Zaratan集群上执行。一个自动化测试工具(任务1)通过精确匹配对封闭式项目进行评分,并通过三层嵌入度量对开放式项目进行评分。随后,一个医生小组(任务2)对最佳模型响应进行审核。

关键词

引用

@article{arxiv.2506.21597,
  title  = {Overview of the ClinIQLink 2025 Shared Task on Medical Question-Answering},
  author = {Brandon Colelough and Davis Bartels and Dina Demner-Fushman},
  journal= {arXiv preprint arXiv:2506.21597},
  year   = {2025}
}

备注

10 pages, 5 figures