中文

分析多模态 LLM 微调中的表示迁移以实现引导

人工智能 2025-08-14 v2 计算与语言 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)在理解多模态输入方面已达到惊人的水平。然而,理解和解释这类复杂模型的行为具有挑战性,更别提在微调期间可能出现的动态变化,或数据集之间出现的协变量漂移。在本工作中,我们针对 MLLM 的理解应用概念层面的分析方法。具体而言,我们提出将隐藏状态映射到可解释的视觉和文本概念。这使我们能够更高效地比较某些语义动态,例如从原始模型到微调后模型之间的变化,揭示在微调过程中可能发生的概念变更及潜在偏差。我们还演示了利用迁移向量捕获这些概念变化的方法。这些迁移向量允许我们通过在原始模型中应用简单、计算成本低的加性概念迁移来恢复微调后的概念。最后,我们的发现直接适用于 MLLM 引导,可用于模型去偏和确保 MLLM 输出的安全性。总体而言,我们提出了一种新型、训练无需、即插即用的数据 MLLM 行为可解释性和控制框架。我们的实现已公开可用。

关键词

引用

@article{arxiv.2501.03012,
  title  = {Analyzing Finetuning Representation Shift for Multimodal LLMs Steering},
  author = {Pegah Khayatan and Mustafa Shukor and Jayneel Parekh and Arnaud Dapogny and Matthieu Cord},
  journal= {arXiv preprint arXiv:2501.03012},
  year   = {2025}
}

备注

ICCV 2025. The first three authors contributed equally. Project page and code: https://pegah- kh.github.io/projects/lmm-finetuning-analysis-and-steering/