走向更好的牙科 AI:面向全景 X 光分析的多模态基准与指令数据集
计算机视觉与模式识别
2025-09-12 v1 多媒体
摘要
最近的大型视觉语言模型(LVLMs)在一般医学任务上表现出色,但在牙科等专业领域的有效性仍未得到充分探索。尤其是口腔放射学中常用的全景 X 光因解剖结构密集且病理信号微妙,现有医学基准或指令数据集并未能捕捉这些特征。为此,我们引入了 MMOral——首个专为全景 X 光解读设计的大规模多模态指令数据集与基准测试。MMOral 包含 20,563 幅标注图像,配套 130 万条跨多任务类型的指令式实例,涵盖属性提取、报告生成、视觉问答及图像导向对话等任务。此外,我们还构建了 MMOral-Bench,涵盖牙科诊断五大关键维度的综合评估套件。我们在 MMOral-Bench 上评估了 64 个 LVLMs,发现即便是表现最佳的模型——GPT-4o——也仅达到 41.45% 的准确率,揭示了当前模型在该领域存在显著局限。为推动该领域发展,我们还提出了 OralGPT,通过在 Qwen2.5-VL-7B 基础上进行有监督微调(SFT),利用经精心筛选的 MMOral 指令数据集进行训练。惊人的是,仅进行一次微调即可显著提升 LVLMs 的性能,例如 OralGPT 相较基线提升了 24.73%。MMOral 与 OralGPT 均具备作为智能牙科重要基础设施的潜力,能够为牙科领域的更临床导向的多模态 AI 系统提供支持。数据集、模型、基准测试及评估套件已于 https://github.com/isbrycee/OralGPT 提供。
引用
@article{arxiv.2509.09254,
title = {Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis},
author = {Jing Hao and Yuxuan Fan and Yanpeng Sun and Kaixin Guo and Lizhuo Lin and Jinrong Yang and Qi Yong H. Ai and Lun M. Wong and Hao Tang and Kuo Feng Hung},
journal= {arXiv preprint arXiv:2509.09254},
year = {2025}
}
备注
40 pages, 26 figures, 9 tables