单样本原语学习对多模态大语言模型任务特定微调的数据选择有何帮助?
多媒体
2026-03-31 v1
摘要
将世界知识注入预训练多模态大语言模型(MLLM)是实现特定领域应用的必需之事。任务特定微调通过针对高质量领域数据实现这一目标,但随着数据集规模扩大,面临可扩展性挑战,需要在性能与计算开销之间进行权衡。现有数据选择方法依赖额外的评分模型或启发式聚类,无法同时聚焦数据重要性与多样性。此外,这两种方法都忽略了训练样本之间的相互作用。为此,我们提出 CLIPPER,一个无需训练的数据选择管道,分离参数与世界知识,利用原语学习探测模型对不同演示-查询组合的响应。CLIPPER 识别出能镜像原始数据集 perplexity 分布的核心子集,在保持关键样本的同时维持多样性。实验在两个 MLLM 和三个数据集上表明,CLIPPER 在显著降低成本的同时匹配完整微调性能:Qwen2.5-VL-7B 在 VRSBench 上实现 47% 的数据效率,Llama-3.2-11B-Vision-Instruct 将 ScienceQA 训练时间缩短 37%。
引用
@article{arxiv.2603.28058,
title = {Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?},
author = {Xiao An and Jiaxing Sun and Ting Hu and Wei He},
journal= {arXiv preprint arXiv:2603.28058},
year = {2026}
}
备注
Accepted by ICME 2026