中文

DentVLM:用于综合性牙科诊断与增强临床实践的多模态视觉语言模型

计算机视觉与模式识别 2025-09-30 v1 人工智能

摘要

诊断和管理口腔疾病需要跨越多种影像模态的高级视觉解释能力,并进行信息整合。虽然当前 AI 模型在单一任务中表现出色,但往往难以满足综合临床牙科实践中复杂的多模态需求。本文引入 DentVLM,一个为专家水平口腔疾病诊断而设计的多模态视觉语言模型。DentVLM 基于 110,447 张图像和 246 万对视觉问答(VQA)对的大规模双语数据集开发而来。该模型能够解释七种 2D 口腔影像模态中的 36 项诊断任务,显著优于领先的专有和开源模型,在口腔疾病上准确率提高 19.6%,在颌面畸形上提高 27.9%。在包含 1,946 名患者和 3,105 对 QA 对的临床研究中,25 名牙科医生评估 DentVLM 时发现,该模型在 36 项任务中的 21 项上超越了 13 名初级牙科医生,在 36 项任务中的 12 项上超过了 12 名高级牙科医生。当集成到协作工作流程中时,DentVLM 将初级牙科医生的诊断性能提升至高级水平,并使所有医务人员的诊断时间缩短 15-22%。此外,DentVLM 在三种实际实用场景中表现出色,包括居家口腔健康管理、医院智能诊断和多智能体协作交互。这些发现表明,DentVLM 作为临床决策支持工具,已成为强大的资源,旨在提升初级牙科护理,缓解供需不平衡,并为牙科领域的专业医学知识提供更广泛的获取途径。

关键词

引用

@article{arxiv.2509.23344,
  title  = {DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice},
  author = {Zijie Meng and Jin Hao and Xiwei Dai and Yang Feng and Jiaxiang Liu and Bin Feng and Huikai Wu and Xiaotang Gai and Hengchuan Zhu and Tianxiang Hu and Yangyang Wu and Hongxia Xu and Jin Li and Jun Xiao and Xiaoqiang Liu and Joey Tianyi Zhou and Fudong Zhu and Zhihe Zhao and Lunguo Xia and Bing Fang and Jimeng Sun and Jian Wu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2509.23344},
  year   = {2025}
}