通过以图像为中心的多标注数据增强医学通才基础模型的多任务学习能力
计算机视觉与模式识别
2025-04-15 v1 人工智能
机器学习
摘要
医学通才基础模型的出现彻底改变了传统的任务特定模型开发范式,旨在通过在大规模医学数据集上的联合训练更好地处理多个任务。然而,最近的进展优先考虑简单的数据扩展或架构组件增强,而忽视了从数据中心视角重新审视多任务学习。关键的是,简单地聚合现有数据资源会导致图像-任务对齐分散,无法培养全面的图像理解或满足临床对多维图像解释的需求。在本文中,我们介绍了以图像为中心的多标注X射线数据集(IMAX),这是首次尝试从数据构建层面增强医学多模态大语言模型(MLLM)的多任务学习能力。具体而言,IMAX具有以下特点:1) 高质量数据整理。全面收集了超过354K条条目,适用于七种不同的医学任务。2) 以图像为中心的密集标注。每张X射线图像平均关联4.10个任务和7.46个训练条目,确保每张图像的多任务表示丰富性。与通用的分散多标注X射线数据集(DMAX)相比,IMAX在七个开源最先进的医学MLLM上持续表现出显著的多任务平均性能提升,范围从3.20%到21.05%。此外,我们研究了IMAX和DMAX训练过程中呈现的统计模式差异,探索了优化动态与多任务性能之间的潜在相关性。最后,利用IMAX数据构建的核心概念,我们提出了一种基于DMAX的优化训练策略,以缓解在实际场景中获取高质量IMAX数据的困境。
引用
@article{arxiv.2504.09967,
title = {Enhancing Multi-task Learning Capability of Medical Generalist Foundation Model via Image-centric Multi-annotation Data},
author = {Xun Zhu and Fanbin Mo and Zheng Zhang and Jiaxi Wang and Yiming Shi and Ming Wu and Chuang Zhang and Miao Li and Ji Wu},
journal= {arXiv preprint arXiv:2504.09967},
year = {2025}
}