Dolphin v1.0 技术报告
计算机视觉与模式识别
2025-10-21 v3 人工智能
摘要
超声在现代医学中至关重要,但面临操作者依赖、图像噪声和实时扫描等挑战,阻碍了人工智能的整合。虽然大型多模态模型在其他医学影像领域表现出色,但它们难以应对超声的复杂性。为解决此问题,我们引入了Dolphin v1.0(V1)及其推理增强版本Dolphin R1——这是首个大规模多模态超声基础模型,在统一的视觉-语言框架内整合了多种临床任务。为应对超声的变异性和噪声,我们构建了一个200万规模的多模态数据集,结合了教科书知识、公开数据、合成样本和通用语料库。这确保了鲁棒的感知、泛化能力和临床适应性。Dolphin系列采用三阶段训练策略:领域专业化预训练、指令驱动的对齐以及基于强化的优化。Dolphin v1.0在分类、检测、回归和报告生成方面提供了可靠的性能。Dolphin R1通过使用超声特定奖励的强化学习,增强了诊断推理、推理透明度和可解释性。在U2-Bench的八项超声任务上评估,Dolphin R1取得了0.5835的U2分数,是第二名模型(0.2968)的两倍多,设立了新的最优水平。Dolphin v1.0也表现出色,验证了统一框架的有效性。比较表明,推理增强训练显著提高了诊断准确性、一致性和可解释性,凸显了其对于高风险医疗人工智能的重要性。
引用
@article{arxiv.2509.25748,
title = {Dolphin v1.0 Technical Report},
author = {Taohan Weng and Kaibing Hu and Henan Liu and Siya Liu and Xiaoyang Liu and Zhenyu Liu and Jiren Ren and Boyan Wang and Boyang Wang and Yiyu Wang and Yalun Wu and Chaoran Yan and Kaiwen Yan and Jinze Yu and Chi Zhang and Duo Zhang and Haoyun Zheng and Xiaoqing Guo and Jacques Souquet and Hongcheng Guo and Anjie Le},
journal= {arXiv preprint arXiv:2509.25748},
year = {2025}
}