RADAR:揭示多模态大语言模型预训练中能力的不对称发展
计算机视觉与模式识别
2026-02-16 v1 人工智能
计算与语言
摘要
预训练的多模态大语言模型通过利用其固有的感知和推理能力来解决复杂任务,为后训练提供了知识丰富的基础。然而,缺乏高效的评估框架阻碍了对其性能瓶颈的诊断。当前的评估主要依赖于监督微调后的测试,这引入了费力的额外训练和自回归解码成本。同时,常见的预训练指标无法以解耦的方式量化模型的感知和推理能力。此外,现有的评估基准通常在规模上有限或与预训练目标不一致。因此,我们提出了RADAR,一个高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中能力的不对称发展。RADAR包含两个关键组成部分:(1) 软判别分数,一种新的度量标准,基于量化模型对正确答案相对于干扰项的偏好的细微梯度,无需微调即可稳健地跟踪能力发展;(2) 多模态混合基准,一个新的包含15000多个样本的基准,用于以零样本方式全面评估预训练多模态大语言模型的感知和推理能力,其中我们统一了权威的基准数据集并仔细收集了新的数据集,扩展了评估范围并解决了当前基准中的关键差距。利用RADAR,我们全面揭示了预训练多模态大语言模型在不同因素(包括数据量、模型大小和预训练策略)下感知和推理能力的不对称发展。我们的RADAR强调了对预训练能力瓶颈进行分解视角的必要性,为高效推进多模态大语言模型提供有针对性的干预措施。我们的代码公开在 https://github.com/Nieysh/RADAR。
引用
@article{arxiv.2602.12892,
title = {RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training},
author = {Yunshuang Nie and Bingqian Lin and Minzhe Niu and Kun Xiang and Jianhua Han and Guowei Huang and Xingyue Quan and Hang Xu and Bokui Chen and Xiaodan Liang},
journal= {arXiv preprint arXiv:2602.12892},
year = {2026}
}