TCMD:用于评估大型语言模型的中医问答数据集
计算与语言
2024-06-10 v1
摘要
近期大型语言模型(LLMs)的空前进步推动了医疗领域的发展,建立了先进的医疗领域模型。然而,由于医疗数据集的收集有限,该领域仅有少数全面基准可用于衡量进展。在本文中,我们介绍了一个新的医疗问答(QA)数据集,包含大量针对解决中医考试任务的手动指令,称为 TCMD。具体而言,我们的 TCMD 收集了跨越 diverse 领域的大量问题,并标注了相应的医学学科,从而支持我们全面评估 LLMs 在中医领域的能力。对 various 通用 LLMs 和医疗领域特定 LLMs 进行了广泛评估。此外,我们还通过引入随机性来分析当前 LLMs 在解决中医 QA 任务中的鲁棒性。实验结果的不一致性也揭示了当前 LLMs 在解答 QA 任务方面的不足。我们还期望该数据集能够进一步促进中医领域 LLMs 的发展。
引用
@article{arxiv.2406.04941,
title = {TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models},
author = {Ping Yu and Kaitao Song and Fengchen He and Ming Chen and Jianfeng Lu},
journal= {arXiv preprint arXiv:2406.04941},
year = {2024}
}