基于偏置约束的多模态智能:实现临床 AI 的公平与可靠
计算机视觉与模式识别
2026-04-21 v1
摘要
医学影像与临床文本的集成已使通用人工智能(AI)系统在医疗保健领域的出现成为可能。然而,偏见问题—such as 疾病患病率不平衡、解剖区域分布偏斜、影像协议异质性以及人口统计学差异,构成了视觉-语言系统在现实临床环境中公平性和可靠性的重大挑战。本文提出了 BiasCareVL,即一种具备偏置感知能力的多模态学习框架,其将偏置控制直接引入模型设计中,而非作为事后校正。BiasCareVL 采用可适应的不确定性建模,并可选用人类在环 refinement 来调节主导数据模式的影响,以在分布不平衡的情况下促进公平推理。该框架在超过 15 种影像模态、344 万样本上进行训练,支持视觉问答、疾病分类、分割和报告生成等多种临床任务,统一于一个表示空间。我们在覆盖皮肤科、肿瘤科、放射科和病理科的八个公开基准测试上进行评估,BiasCareVL 在所有 20 种最先进方法中均表现出色,在临床上尤为具挑战性的场景中取得显著提升,包括在多类皮肤瘤诊断中实现 10% 以上的准确率提升,在小肿瘤分割中实现 Dice 分数提升 20% 以上。此外,BiasCareVL 在评估中表现出超过人类水平的诊断性能,且所需时间大幅缩短。我们计划开源 BiasCareVL,以推动医疗 AI 未来实现透明、可重复且公平,为通用、可信且临床可靠的 AI 系统铺路。
引用
@article{arxiv.2604.16884,
title = {Bias-constrained multimodal intelligence for equitable and reliable clinical AI},
author = {Cheng Li and Weijian Huang and Jiarun Liu and Hao Yang and Qi Yang and Song Wu and Ye Li and Hairong Zheng and Shanshan Wang},
journal= {arXiv preprint arXiv:2604.16884},
year = {2026}
}