LEAML:面向多模态大语言模型的标签高效外分布视觉任务适配框架
计算机视觉与模式识别
2025-10-06 v1
摘要
多模态大语言模型(MLLM)在一般视觉基准上取得了强大的性能,但在医学影像等专业领域的外分布(OOD)任务中仍面临挑战,此时标记数据稀缺且昂贵。我们引入 LEAML,一个标签高效适配框架,利用稀少的标记 VQA 样本和丰富的无标记图像。我们的方法通过 caption distillation 正则化的 QA 生成器为无标记数据生成领域相关的伪问答对。重要的是,我们仅选择与问答最相关的神经元进行更新,使 QA 生成器能够在蒸馏期间高效获取领域特定知识。实验在胃肠镜和体育 VQA 上均表明,LEAML 在最小监督下 consistently 超过标准微调,凸显了我们提出的 LEAML 框架的有效性。
引用
@article{arxiv.2510.03232,
title = {LEAML: Label-Efficient Adaptation to Out-of-Distribution Visual Tasks for Multimodal Large Language Models},
author = {Ci-Siang Lin and Min-Hung Chen and Yu-Yang Sheng and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2510.03232},
year = {2025}
}