DentalGPT:激励牙科多模态复杂推理
计算机视觉与模式识别
2025-12-15 v1 人工智能
计算与语言
摘要
可靠的解释牙科多模态数据对于自动化口腔健康至关重要, 但当前的多模态大语言模型(MLLM)在捕捉牙科细粒度视觉细节方面存在挑战, 且缺乏进行精确诊断的足够推理能力。为此, 我们提出了 DentalGPT, 一个通过高质量领域知识注入和强化学习开发的专用牙科 MLLM。具体而言, 我们构建了目前为止规模最大的牙科多模态数据集, 通过聚合超过 12 万张牙科图像, 并配以详细描述, 突出诊断相关的视觉特征, 使其成为收录牙科图像最广泛的数据集。在该数据集上进行训练显著增强了 MLLM 对牙科病 condition 的视觉理解能力, 而随后的强化学习阶段进一步强化了其进行多模态复杂推理的能力。全面的评估在口内影像和全景影像基准测试中进行, 以及牙科医学 VQA 基准测试的子集中, 显示 DentalGPT 在疾病分类和牙科 VQA 任务中表现出优越性能, 在拥有仅 7B 参数的情况下, 超越了许多最先进的 MLLM。这些结果表明, 高质量的牙科数据结合分阶段适应性方法, 为构建有能力且领域专业化的牙科 MLLM 提供了有效路径。
引用
@article{arxiv.2512.11558,
title = {DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry},
author = {Zhenyang Cai and Jiaming Zhang and Junjie Zhao and Ziyi Zeng and Yanchao Li and Jingyi Liang and Junying Chen and Yunjin Yang and Jiajun You and Shuzhi Deng and Tongfei Wang and Wanting Chen and Chunxiu Hao and Ruiqi Xie and Zhenwei Wen and Xiangyi Feng and Zou Ting and Jin Zou Lin and Jianquan Li and Guangjun Yu and Liangyi Chen and Junwen Wang and Shan Jiang and Benyou Wang},
journal= {arXiv preprint arXiv:2512.11558},
year = {2025}
}