CHBench:用于评估大型语言模型中文健康能力的基准数据集
计算与语言
2025-02-24 v2
摘要
随着大型语言模型(LLM)的快速发展,评估其在健康相关查询方面的性能变得日益重要。将这些模型应用于实际场景——其中,错误信息可能导致寻求医疗建议和支持的个体面临严重后果—— necessitates 将安全性和可信赖性置于首位。在本工作中,我们引入CHBench,这是第一个全面的以安全为导向的中文健康相关基准,旨在从多样化场景中以安全视角评估大型语言模型在理解和处理物理健康与心理健康问题方面的能力。CHBench涵盖6,493条心理健康条目和2,999条身体健康条目,涉及广泛主题。我们对四个流行的中文大型语言模型进行了广泛评估,结果显示其在提供安全和准确健康信息方面存在显著不足,凸显了在这一关键领域仍需进一步进步的紧迫性。该代码已公开于https://github.com/TracyGuo2001/CHBench。
引用
@article{arxiv.2409.15766,
title = {CHBench: A Chinese Dataset for Evaluating Health in Large Language Models},
author = {Chenlu Guo and Nuo Xu and Yi Chang and Yuan Wu},
journal= {arXiv preprint arXiv:2409.15766},
year = {2025}
}
备注
11 pages