DRIFT:用于高效 MLLM 微调的推理先验迁移
计算机视觉与模式识别
2026-04-28 v2
摘要
多模态大型语言模型(MLLM)取得了快速进展,但其推理能力常常落后于强大的文本-only LLM。弥合这一差距通常需要大规模的多模态推理数据或强化学习,造成巨大的成本。一个有吸引力的替代方案是参数空间模型之间的合并,但我们表明直接合并极其脆弱:其有效性在不同模型家族间差异很大,且可能显著降低性能(例如对于 Qwen 系列 MLLM)。我们提出了 Direction Reasoning Injection for Fine-Tuning(DRIFT),这是一种轻量级方法,通过梯度空间转移推理知识以保持多模态对齐。DRIFT 从文本-only 推理专家与多模态模型之间的参数差异中预计算推理先验,并用于在监督微调期间偏导数。这种设计保留了标准 SFT 流水线的简单性,同时实现了高效稳定的推理转移。在包括 MathVista 和 MathVerse 在内的多模态推理基准测试中的实验表明,DRIFT 持续优于直接合并和标准 SFT,并在大幅降低数据和计算资源消耗后,匹配或超越训练密集型方法。
引用
@article{arxiv.2510.15050,
title = {DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning},
author = {Chao Huang and Zeliang Zhang and Jiang Liu and Ximeng Sun and Jialian Wu and Xiaodong Yu and Ze Wang and Chenliang Xu and Emad Barsoum and Zicheng Liu},
journal= {arXiv preprint arXiv:2510.15050},
year = {2026}
}
备注
ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/