CURE:用于可靠解剖学锚定报告生成的课程引导多任务训练
计算机视觉与模式识别
2026-01-23 v1 人工智能
计算与语言
机器学习
摘要
医学视觉-语言模型可以自动化生成放射学报告,但在准确的视觉锚定和事实一致性方面存在困难。现有模型经常将文本发现与视觉证据错位,导致不可靠或弱锚定的预测。我们提出了 CURE,一个错误感知的课程学习框架,它在不使用任何额外数据的情况下改进了锚定和报告质量。CURE 在公开数据集上对多模态指令模型进行短语锚定、锚定报告生成和解剖学锚定报告生成的微调。该方法根据模型性能动态调整采样,强调较难的样本以改进空间和文本对齐。CURE 将锚定准确率提高了 +0.37 IoU,将报告质量提升了 +0.188 CXRFEScore,并将幻觉减少了 18.6%。CURE 是一个数据高效的框架,同时增强了锚定准确性和报告可靠性。代码可在 https://github.com/PabloMessina/CURE 获取,模型权重可在 https://huggingface.co/pamessina/medgemma-4b-it-cure 获取。
引用
@article{arxiv.2601.15408,
title = {CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation},
author = {Pablo Messina and Andrés Villa and Juan León Alcázar and Karen Sánchez and Carlos Hinojosa and Denis Parra and Álvaro Soto and Bernard Ghanem},
journal= {arXiv preprint arXiv:2601.15408},
year = {2026}
}
备注
31 pages, 7 figures, submitted to CVPR 2026 (under review)