OralMLLM-Bench:评估多模态大语言模型在牙科实践中的认知能力
计算与语言
2026-05-11 v2
摘要
多模态大语言模型(MLLM)已成为牙科图像分析的有前景的范例,但其是否能够捕捉到牙科放射图像分析所需的多层次认知过程仍不明确。本文提出一个全面的基准测试,用于评估MLLM在牙科放射图像分析中的认知能力。该基准覆盖三个关键成像模态,即根尖片、全景片和侧位头影片,并定义四个认知类别:感知、理解、预测和决策。该基准包含27个来自公共数据集的临床导向任务,配有手动精选的注释和3,820项临床医生评估用于评估。评估了六个前沿MLLM,包括GPT-5.2和GLM-4.6。我们展示了MLLM与牙科临床实践之间的性能差距,描绘了模型的优势与局限性,特征化了失败模式,并提供了改进建议。这一数据资源将促进下一代人工智能系统的开发,这些系统与临床认知、安全要求和工作流程复杂性相匹配。
引用
@article{arxiv.2605.01333,
title = {OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice},
author = {Rongyang Wang and Shuang Zhou and Jiashuo Wang and Wenya Xie and Xiaoxia Che},
journal= {arXiv preprint arXiv:2605.01333},
year = {2026}
}
备注
21 pages, 4 figures, 5 tables