MedEthicEval:基于中国医学伦理的大型语言模型评估
计算与语言
2025-03-05 v1
摘要
大型语言模型(LLM)在推进医疗应用方面展现出巨大潜力,但其在应对医学伦理挑战方面的能力仍有待深入探索。本文介绍了 MedEthicEval,一种旨在系统评估 LLM 在医学伦理领域表现的新型基准。我们的框架包含两个关键部分:知识,评估模型对医学伦理原则的掌握程度;应用,侧重于模型在不同场景中应用这些原则的能力。为支持该基准,我们咨询了医学伦理研究人员,并开发了三个应对不同伦理挑战的数据集:明显违背医学伦理的行为、具有明确倾向性的优先困境,以及没有明显解决方案的平衡困境。MedEthicEval 可作为理解 LLM 在医疗保健中伦理推理的关键工具,为其在医疗场景中的负责任和有效使用铺平道路。
引用
@article{arxiv.2503.02374,
title = {MedEthicEval: Evaluating Large Language Models Based on Chinese Medical Ethics},
author = {Haoan Jin and Jiacheng Shi and Hanhui Xu and Kenny Q. Zhu and Mengyue Wu},
journal= {arXiv preprint arXiv:2503.02374},
year = {2025}
}