Pathology-CoT:从专家全切片图像诊断行为中学习视觉思维链智能体
计算机视觉与模式识别
2025-10-15 v2
摘要
全切片图像的诊断是一个改变放大倍数并在视野之间移动的交互式、多阶段过程。尽管最近的病理学基础模型表现出卓越的性能,但仍缺乏能够决定下一步检查哪个视野、调整放大倍数并提供可解释诊断的实用智能体系统。这种局限性很大程度上受到数据的瓶颈:对专家观察行为的可扩展、临床对齐的监督是隐性的且基于经验的,未记录在教科书或互联网中,因此未包含在 LLM 训练中。在此,我们引入一个旨在通过三个关键突破应对这一挑战的框架。首先,AI Session Recorder 与标准全切片图像查看器无缝集成,不引人注目地记录常规导航,并将查看器日志转换为标准化行为命令和边界框。其次,轻量级的人在回路审查将行为命令的 AI 起草理由转化为 Pathology-CoT 数据集,形成配对的“看哪里”和“为什么重要”的形式,与手动构建此类思维链数据集相比,标注速度提高了六倍。使用这些行为数据,我们构建了 Pathology-o3,这是一个两阶段智能体,首先提出重要的感兴趣区域 (ROI),然后执行行为引导的推理。在胃肠道淋巴结转移检测任务中,我们的方法在 Stanford Medicine 的内部验证中实现了 100 的召回率,在来自瑞典的独立外部验证中实现了 97.6 的召回率,超过了 state-of-the-art 的 OpenAI o3 模型,并在不同骨干网络中具有泛化性。据我们所知,Pathology-CoT 构成了病理学中首批基于行为基础的智能体系统之一。通过将日常查看器日志转化为可扩展的、经专家验证的监督,我们的框架使智能体病理学变得实用,并为人类对齐、可升级的临床 AI 建立了路径。
引用
@article{arxiv.2510.04587,
title = {Pathology-CoT: Learning Visual Chain-of-Thought Agent from Expert Whole Slide Image Diagnosis Behavior},
author = {Sheng Wang and Ruiming Wu and Charles Herndon and Yihang Liu and Shunsuke Koga and Jeanne Shen and Zhi Huang},
journal= {arXiv preprint arXiv:2510.04587},
year = {2025}
}