中文

Pocket-Dentist:基于高效多模态大语言模型的设备内牙科图像理解

计算机视觉与模式识别 2026-05-29 v1 人工智能

摘要

牙科视觉语言模型的评估在数据集、任务定义和度量指标方面往往不完整,并且常常忽视其计算成本。这限制了其在牙科筛查中心之外的广泛部署,在那里及时推理、有限的硬件资源以及本地处理患者图像对于实际、隐私保护的临床预筛查至关重要。本文我们提出了 Pocket-Dentist—a 一个面向牙科多模态问答的效率意识基准,汇集了约1159名患者、5种任务类型和7种度量指标。我们的结果揭示了有趣的观察:紧凑型视觉语言模型(如2B参数模型)在牙科图像理解中在准确率上超过更大的模型,同时需要的计算资源显著更低。在iPhone 17 Pro上本地部署的我们微调后的紧凑型 VLM Pocket-Dentist-2B 处理每个样本仅需4.31秒,比7B基线模型的延迟降低了4.9倍,内存使用降低了2.3倍。

关键词

引用

@article{arxiv.2605.29299,
  title  = {Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models},
  author = {Kai Bian and Xucheng Guo and Bin Chen and Lingyan Ruan and Yiran Shen and Ting Dang and Hong Jia},
  journal= {arXiv preprint arXiv:2605.29299},
  year   = {2026}
}