CMQCIC-Bench:用于评估大语言模型在医学质量控制指标计算中的中文基准测试集
计算与语言
2025-07-10 v2
摘要
医学质量控制指标是评估医疗机构资格以提供医疗服务的关键指标。随着大型语言模型 (LLM) 如 GPT-4 在医学领域的卓越表现,利用这些技术进行医学质量控制指标计算 (MQCIC) presents an 具有前景的 approach。In this work, (1) 我们介绍了一个真实世界的任务 MQCIC 并提出一个开源的中文电子病历 (EMR)-based 数据集 (CMQCIC-Bench),包含 785 个实例和 76 个指标。(2) 我们提出了一种半自动方法来增强规则表示。然后我们提出了基于临床事实的推理规则 (CF-IR) 方法,该方法分离了临床事实验证和推理规则推理动作。(3) 我们在 20 个代表性 LLM 上进行了全面实验,涵盖通用模型和医学模型。我们的发现表明 CF-IR 在 MQCIC 任务中优于链式思考方法。(4) 我们进行了错误分析并研究了临床事实验证和推理规则推理能力,为进一步提高 MQCIC 性能提供了见解。该数据集和代码已提供于本存储库 https://github.com/YuY-2001/C-MQCIC。
引用
@article{arxiv.2502.11703,
title = {CMQCIC-Bench: A Chinese Benchmark for Evaluating Large Language Models in Medical Quality Control Indicator Calculation},
author = {Guangya Yu and Yanhao Li and Zongying Jiang and Yuxiong Jin and Li Dai and Yupian Lin and Ruihui Hou and Weiyan Zhang and Yongqi Fan and Qi Ye and Jingping Liu and Tong Ruan},
journal= {arXiv preprint arXiv:2502.11703},
year = {2025}
}
备注
2025 ACL Findings