中文

面向大型视觉语言模型的综合多模态口腔颌面医学数据集

计算机视觉与模式识别 2025-11-10 v1 人工智能

摘要

人工智能在口腔医疗领域的发展依赖于能够捕捉临床实践复杂性的大规模多模态数据集。本文提出了一个综合性多模态数据集,包含 8775 例 4800 名患者(年龄 10-90 岁)在 2018-2025 年期间收集的口腔检查记录。数据集包含 50000 张颌部内视野图像、8056 张放射科检查图像,以及详细的文本记录,包括诊断、治疗计划和随访记录。数据按标准伦理指南收集并标注,以便基准测试。为演示其实用性,我们对 Qwen-VL 3B 和 7B 等最新大型视觉语言模型进行微调,并在六项口腔颌面异常分类和从多模态输入生成完整诊断报告生成两个任务上进行评估。我们将微调后的模型与基线模型和 GPT-4o 进行比较。结果表明,微调后的模型在这些基线上实现了显著提升,验证了数据集的有效性,强调了其在推动 AI 驱动的口腔颌面医疗解决方案方面的作用。该数据集已公开,为未来的 AI 牙科研究提供了 essential 资源。

关键词

引用

@article{arxiv.2511.04948,
  title  = {A benchmark multimodal oro-dental dataset for large vision-language models},
  author = {Haoxin Lv and Ijazul Haq and Jin Du and Jiaxin Ma and Binnian Zhu and Xiaobing Dang and Chaoan Liang and Ruxu Du and Yingjie Zhang and Muhammad Saqib},
  journal= {arXiv preprint arXiv:2511.04948},
  year   = {2025}
}