中文

DeepSeek 在牙科案例中优于其他大型语言模型

计算与语言 2025-09-03 v1 人工智能

摘要

大型语言模型 (LLM) 在医疗领域具有变革性潜力,但其解读纵向患者叙事的能力尚未得到充分探讨。牙科医学因其丰富的结构化临床数据,为严格评估 LLM 推理能力提供了独特机会。虽然已有多个商业 LLM 存在,但 DeepSeek——一款在本年初获得广泛关注的模型——也加入了竞争。本研究评估了四个最新 LLM (GPT-4o、Gemini 2.0 Flash、Copilot 和 DeepSeek V3) 在分析纵向牙科案例 vignettes 方面的能力,通过开放式临床任务进行评估。使用 34 个标准化纵向牙周病例(包含 258 个 question-answer 对),我们通过自动化指标和盲目评估(由执业牙医进行)评估模型性能。DeepSeek 以领先性能脱颖而出,展现出在忠实性 (median = 0.528 vs. 0.367-0.457) 和更高的专家评分 (median = 4.5/5 vs. 4.0/5) 方面的优势,同时未显著牺牲可读性。我们的研究将 DeepSeek 定位为案例分析的领先 LLM,倡导将其作为医学教育和研究中的辅助工具集成,凸显其作为特定领域智能体的潜力。

关键词

引用

@article{arxiv.2509.02036,
  title  = {DeepSeek performs better than other Large Language Models in Dental Cases},
  author = {Hexian Zhang and Xinyu Yan and Yanqi Yang and Lijian Jin and Ping Yang and Junwen Wang},
  journal= {arXiv preprint arXiv:2509.02036},
  year   = {2025}
}

备注

Abstract word count: 171; Total word count: 3130; Total number of tables: 2; Total number of figures: 3; Number of references: 32