中文

DinoDental:将 DINOv3 作为牙科图像分析统一视觉编码器的基准测试

计算机视觉与模式识别 2026-03-31 v1

摘要

牙科影像中专家标注稀缺且成本高高,这是开发牙科 AI 领域技术的重大挑战。DINOv3 作为一种基于 17 亿张图像预训练的领先的自监督视觉基础模型,为缓解此问题提供了可行路径。然而,其在牙科领域的可靠性——该领域具有独特的影像特征和临床细微差别——尚不明确。为此,我们引入 DinoDental,一个统一基准测试,旨在系统评估 DINOv3 是否可作为无需领域特定预训练即可进行全面牙科图像分析的可靠即插即用编码器。由多个公开数据集构建的 DinoDental 涵盖了广泛的任务,包括在全景牙科影像和口内照片上的分类、检测和实例分割。我们进一步通过调整模型大小和输入分辨率,并比较不同的适应策略(包括冻结特征、完全微调和参数高效 Low-Rank 适配 (LoRA) 方法),分析模型的迁移性能。我们的实验表明,DINOv3 可作为牙科图像分析中强大的统一编码器,涵盖全景牙科影像和口内照片,各任务中保持竞争力,尤其在口内图像理解和边界敏感的稠密预测中显示出明显优势。总体而言,DinoDental 为全面评估 DINOv3 在牙科分析中的表现提供了系统框架,为牙科 AI 社区指导高效和有效的模型选择和适应提供了基础基准。

关键词

引用

@article{arxiv.2603.28297,
  title  = {DinoDental: Benchmarking DINOv3 as a Unified Vision Encoder for Dental Image Analysis},
  author = {Kun Tang and Xinquan Yang and Mianjie Zheng and Xuefen Liu and Xuguang Li and Xiaoqi Guo and Ruihan Chen and Linlin Shen and He Meng},
  journal= {arXiv preprint arXiv:2603.28297},
  year   = {2026}
}