中文

OralAgent:用于交互式牙科图像分析的推理、工具与知识集成代理

计算与语言 2026-05-28 v1 计算机视觉与模式识别 多智能体系统

摘要

牙科图像分析在支撑口腔护理中准确诊断和治疗计划规划中发挥着关键作用。尽管近期进展为特定任务和单一成像模态的人造牙科AI模型提供了所谓的解决方案,但其孤立的设计限制了在实际临床工作流程中的实际应用。本文提出OralAgent——首个专为牙科领域设计的AI代理,实现了多模态推理、基于工具的决策制定和知识驱动检索于一体的端到端自动化框架。其集成了22项视觉分析工具和368部广泛使用的经典牙科教科书,实现自主推理、计划、工具使用、知识检索和多步骤工作流程执行。进一步引入OralCorpus——一个规模庞大且高质量的双语文本资源,包含13480万token,专为牙科检索增强生成(RAG)而构建。为评估模型的跨学科牙科知识,我们构建OralQA-ZH——一个由798个题目构成的中文多选题基准,覆盖十个口腔亚专科。大量实验表明,OralAgent在MMOral-Uni、MMOral-OPG和OralQA-ZH基准上实现了最先进的性能,凸显了其在实际临床环境中的有效性、可解释性和适应性。代码与模型已公开于https://github.com/isjinghao/OralAgent。

关键词

引用

@article{arxiv.2605.27378,
  title  = {OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis},
  author = {Jing Hao and Siyuan Dai and Yongxin Zhang and Yuci Liang and Jiamin Wu and Jiahao Bao and Yuxuan Fan and Zanting Ye and Yanpeng Sun and Xinyu Zhang and Ming Hu and Liang Zhan and James Kit Hon Tsoi and Linlin Shen and Junjun He and Kuo Feng Hung},
  journal= {arXiv preprint arXiv:2605.27378},
  year   = {2026}
}

备注

14 pages, 7 figures, 6 tables