DentalBench:面向双语牙科理解的 LLM 能力基准测试与提升
计算与语言
2025-08-29 v1 人工智能
摘要
近期大语言模型(Large Language Models, LLMs)及医学 LLMs(Medical LLMs, Med-LLMs)的进展显示出在一般医学基准测试上的强大性能。然而,由于缺乏针对性评估资源,他们在需要深入领域特定知识的专业医学领域(如牙科)方面的能力仍未得到充分探索。在本文中,我们引入DentalBench,第一个为评估和提升LLMs在牙科领域能力而设计的全面双语基准测试。DentalBench由两个主要组成部分构成:DentalQA,一个覆盖4个任务和16个牙科子领域的英汉问答(question-answering, QA)基准,包含36,597个问题;以及DentalCorpus,一个规模为33735万token的大型高质量语料库,专为牙科领域适配而构建,支持监督微调(Supervised Fine-Tuning, SFT)和检索增强生成(Retrieval-Augmented Generation, RAG)。我们评估了14个LLMs,涵盖专有、开源和医学专用模型,发现不同任务类型和语言之间存在显著的性能差距。进一步的实验表明,Qwen-2.5-3B在进行领域适配后在知识密集型和术语导向型任务上性能显著提升,突显了针对开发面向医疗应用的可信赖且有效LLMs而设定领域特定基准的重要性。
引用
@article{arxiv.2508.20416,
title = {DentalBench: Benchmarking and Advancing LLMs Capability for Bilingual Dentistry Understanding},
author = {Hengchuan Zhu and Yihuan Xu and Yichen Li and Zijie Meng and Zuozhu Liu},
journal= {arXiv preprint arXiv:2508.20416},
year = {2025}
}