MNAFT:面向多模态大语言模型的模态神经元感知微调用于图像翻译
计算与语言
2026-04-21 v1
摘要
多模态大语言模型(MLLMs)展现了惊人的能力,但往往难以有效捕捉图像中关键细粒度文本信息,以实现准确的图像翻译。这会导致视觉文本输入与文本输入/输出之间存在模态差距。现有方法主要依赖指令微调,风险在于预训练知识的参数冗余,阻碍泛化性能。为此,我们引入模态神经元感知微调(MNAFT),一种新方法,利用 MLLM 中各个神经元在增强图像翻译中的专门角色。MNAFT 通过指令驱动的激活分析识别视觉和语言模块中语言无关和语言特定的神经元,评估其在各种翻译任务中的重要性。随后进行选择性微调,只更新与目标任务相关的语言特定和语言无关神经元的参数,同时保留其他神经元和层中编码的知识。我们的广泛实验表明,MNAFT 在多个基准测试上均显著优于最先进的图像翻译方法,包括级联模型、标准全微调和参数高效调优技术。进一步,我们提供了全面的分析,包括神经元激活和聚类模式的可视化,以提供对不同神经元组在跨模态理解和促进准确语言特定翻译中作用的见解。
引用
@article{arxiv.2604.16943,
title = {MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation},
author = {Bo Li and Ningyuan Deng and Tianyu Dong and Shaobo Wang and Shaolin Zhu and Lijie Wen},
journal= {arXiv preprint arXiv:2604.16943},
year = {2026}
}
备注
Accepted by SCIS (SCIENCE CHINA Information Science)