基于批量增强和单模态微调的多模态学习
计算机视觉与模式识别
2025-05-13 v1
摘要
本文提出了一种结合批量增强和单模态微调的方法,用于从超声图像和相关临床文本信息中检测胎儿器官。我们还规定了在多模态训练前对初始层进行医学数据预训练。首先,我们应用迁移初始化,使用图像部分数据集进行批量增强。这一步调整了医学数据的初始层权重。然后,我们应用具有微调初始层的神经网络(NN)对图像进行批量增强,以获取特征。我们还从图像描述中提取信息。我们将此信息与从图像中获取的特征相结合,用于训练头部层。我们编写了一个数据加载器脚本来加载多模态数据,并使用现有的单模态图像增强技术对多模态数据进行批量增强。数据加载器为每个 batch 提供新的随机增强,以获得良好的泛化。我们研究了 FPU23 超声和 UPMC Food-101 多模态数据集。采用所提出方法训练的多模态大型语言模型(LLM)在所调查的方法中取得最佳结果。我们在 UPMC Food-101 数据集上获得了接近最新(SOTA)的性能。我们在以下仓库分享了所提出方法及其传统对手的脚本:github.com/dipuk0506/multimodal
引用
@article{arxiv.2505.06592,
title = {Batch Augmentation with Unimodal Fine-tuning for Multimodal Learning},
author = {H M Dipu Kabir and Subrota Kumar Mondal and Mohammad Ali Moni},
journal= {arXiv preprint arXiv:2505.06592},
year = {2025}
}