中文

OralGPT:用于口腔黏膜疾病诊断与描述的两阶段视觉语言模型

定量方法 2025-10-17 v1

摘要

口腔黏膜疾病,如白塞综合征、口腔lichen planus 和复发性口腔溃疡,呈现出多样且重叠的视觉特征,使非专家难以诊断。虽然视觉语言模型(VLMs)在医学图像解释方面显示出前景,但其在口腔护理领域的应用仍鲜有探索,主要由于缺乏大规模、标注完善的数据集。本文我们提出了 OralGPT,这是首个为口腔黏膜疾病诊断和描述设计的领域特定两阶段视觉语言框架。在阶段 1,OralGPT 从分类标签中学习视觉表征和疾病相关概念。在阶段 2,它利用长篇专家撰写的描述性文本增强其语言生成能力。为克服标注瓶颈,我们提出了一种新颖的基于相似性指导的数据增强策略,将专家标注图像中的描述性知识传递给弱标注图像。我们还构建了口腔黏膜疾病的首个基准数据集,集成了来自多个来源的图像数据,包含结构化和非结构化文本注释。在四种常见口腔疾病上的实验结果表明,OralGPT 能够实现具竞争力的诊断性能,同时生成流畅、临床上有意义的图像描述。该研究为口腔护理中的语言辅助诊断工具奠定了基础。

关键词

引用

@article{arxiv.2510.13911,
  title  = {OralGPT: A Two-Stage Vision-Language Model for Oral Mucosal Disease Diagnosis and Description},
  author = {Jia Zhang and Bodong Du and Yitong Miao and Dongwei Sun and Xiangyong Cao},
  journal= {arXiv preprint arXiv:2510.13911},
  year   = {2025}
}