中文

基于视觉语言模型的单牙牙科图像提示式描述生成

计算机视觉与模式识别 2026-03-10 v1

摘要

数字牙科因深度学习的出现取得了显著进展。然而,这些深度学习驱动的牙科图像分析模型大多聚焦于特定任务,如牙齿分割、牙齿检测、龋齿检测和牙周炎分类。缺乏一种具备整体牙齿知识并能基于此进行牙科图像分析的专用模型。目前,带有描述的牙科图像数据集数量稀少且覆盖范围有限。许多数据集中,描述涉及整张口腔,而图像仅限于前侧视角,导致后侧牙齿(如牵nz)无法清晰呈现,限制了这些描述在训练视觉语言模型时的实用性。此外,描述仅关注特定疾病(牙周炎),无法对每颗牙齿进行全面评估。牙科疾病评分通常针对单个牙齿进行,牙齿在正畸过程中也被视为独立实体。因此,为单牙图像生成描述具有重要意义。本文旨在填补这一空白,通过评估使用视觉语言模型 (VLM) 生成牙科图像描述的可能性,并衡量这些描述的质量和水平。我们的发现表明,引导式提示有助于 VLM 生成有意义的描述。我们展示,由本框架生成的提示在描述牙科图像视觉要素方面更为精准。我们选取 RGB 图像,因为其在消费场景中更具潜力。

关键词

引用

@article{arxiv.2603.07403,
  title  = {Prompt-Based Caption Generation for Single-Tooth Dental Images Using Vision-Language Models},
  author = {Anastasiia Sukhanova and Aiden Taylor and Julian Myers and Zichun Wang and Kartha Veerya Jammuladinne and Satya Sri Rajiteswari Nimmagadda and Aniruddha Maiti and Ananya Jana},
  journal= {arXiv preprint arXiv:2603.07403},
  year   = {2026}
}

备注

Accepted to IEEE International Conference on Semantic Computing (IEEE ICSC 2026)