中文

OralGPT-Omni:一个通用的牙科多模态大语言模型

计算机视觉与模式识别 2025-12-01 v1 多媒体

摘要

多模态大语言模型(MLLM)在诸多医学专科领域展现出巨大的潜力;然而,牙科领域仍鲁争,部分原因是数据有限、牙科专家标注稀缺、模态特化建模不足以及可靠性挑战。本文提出 OralGPT-Omni,是首个专为牙科设计的 MLLM,旨在实现对多种牙科成像模态和临床任务的全面可信分析。为显式捕获牙科医生的诊断推理过程,我们构建了 TRACE-CoT 数据集,旨在镜像牙科放射科学家的决策过程。这种推理监督结合我们提出的四阶段训练范式,显著增强了模型进行牙科图像理解和分析的能力。同时,我们引入 MMOral-Uni,这是首个用于牙科图像分析的统一多模态基准数据集。它包含 2809 对开放式问答对,涵盖五种模态和五种任务,为 MLLM 在牙科数字化方面的综合评估提供了目前为止最全面的套件。OralGPT-Omni 在 MMOral-Uni 数据集上获得 51.84 分,在 MMOral-OPG 数据集上获得 45.31 分,显著超越 GPT-5 的得分。这一工作推动了智能牙科的发展,为牙科图像分析的未来进步铺平了道路。所有代码、基准数据集和模型将公开提供。

关键词

引用

@article{arxiv.2511.22055,
  title  = {OralGPT-Omni: A Versatile Dental Multimodal Large Language Model},
  author = {Jing Hao and Yuci Liang and Lizhuo Lin and Yuxuan Fan and Wenkai Zhou and Kaixin Guo and Zanting Ye and Yanpeng Sun and Xinyu Zhang and Yanqi Yang and Qiankun Li and Hao Tang and James Kit-Hon Tsoi and Linlin Shen and Kuo Feng Hung},
  journal= {arXiv preprint arXiv:2511.22055},
  year   = {2025}
}

备注

47 pages, 42 figures, 13 tables