OralGPT-Plus:基于强化学习学习使用视觉工具用于全景牙科X光分析
计算机视觉与模式识别
2026-03-09 v1
摘要
全景牙科X光片需要精细的空间推理、双侧对称性理解以及多步骤诊断验证,但现有的视觉语言模型 operate under a static single-pass paradigm,这限制了其临床可靠性。本文引入 OralGPT-Plus,一种用于全景牙科X光片分析的代理人式视觉语言模型,旨在执行具有迭代性和对称性感知的诊断推理。为支持这一范式,我们构建了 DentalProbe,一个包含五千张图像且由专家精选诊断轨迹的数据集,提供结构化的监督,用于局部检查和对侧比较。我们进一步开发了以复检驱动的强化学习框架,通过基于评分的奖励和条件诊断驱动的奖励来鼓励临床有意义的复查,并稳定长期推理。同时,我们提出了 MMOral-X,即首个用于全面全景诊断的基准,包含 300 个开放式问题以及跨多个难度级别的区域级注释。OralGPT-Plus 在 MMOral-X 以及既定的全景基准上均显著优于强基线,表明交互式和对称性感知推理的有效性。我们的工作凸显了代理人建模在牙科成像中的价值,为未来在临床导向的全景牙科X光片分析研究提供了基础。
引用
@article{arxiv.2603.06366,
title = {OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis},
author = {Yuxuan Fan and Jing Hao and Hong Chen and Jiahao Bao and Yihua Shao and Yuci Liang and Kuo Feng Hung and Hao Tang},
journal= {arXiv preprint arXiv:2603.06366},
year = {2026}
}
备注
34 pages, 24 figures, conference