中文

DentiAsk:全景牙科X光片多模态推理的VQA基准

定量方法 2026-06-29 v1

摘要

准确解读全景牙科X光片需要整合多种推理能力:检测、空间定位和定量评估。尽管多模态学习近期取得了进展,现有的医学视觉问答(VQA)基准并未完全捕捉这种复杂性,往往将任务简化为分类或模板化查询。因此,它们对临床有意义解读所需的各种推理过程的覆盖有限。我们推出了DentiAsk,一个大规模牙科VQA基准,将高分辨率全景牙科X光片与经临床医生验证的问答对配对,涵盖三个推理层级:描述性识别、空间定位和数值量化,涉及三种高患病率病理:根尖周透射影(PARL)、阻生牙和龋齿。DentiAsk包含1,000张高分辨率X光片,标注了10,000个专家精选的问答对。据我们所知,这是首个在单一评估框架内将分类、空间和定量推理作为独立评分任务统一起来的牙科VQA基准。我们对10个最先进的视觉语言模型进行了基准测试,包括LLaVA-v1.5、LLaVA-v1.6、Qwen-VL、InternVL2和LLaVA-Med,发现模型在描述性查询上表现较强,而在空间定位和计数上性能急剧下降,暴露了组合式、多步推理的局限性。这些发现揭示了视觉识别与临床意义推理之间的差距,确立了DentiAsk作为推进医学成像多模态推理的挑战性基准。

关键词

引用

@article{arxiv.2607.08790,
  title  = {DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs},
  author = {Debesh Jha and Tapas Kumar Dutta and Roshan Paudel and Onkar Kishor Susladkar and Aashish Ghimire and Anupam Dhakal and Sabin Adhikari and Nand Kumar Yadav and Deepak Ranjan Nayak and Pravin Pawar and William C. W. Chen and Glenda Reynolds},
  journal= {arXiv preprint arXiv:2607.08790},
  year   = {2026}
}