中文

用于免训练自适应的高效多模态长上下文学习

计算机视觉与模式识别 2025-05-27 v1

摘要

将多模态大语言模型(MLLM)适配到新任务的传统方法严重依赖微调。本文介绍了高效多模态长上下文学习(EMLoC),这是一种新颖的免训练替代方案,将示例直接嵌入到模型输入中。EMLoC 为任务自适应提供了更高效、灵活且可扩展的解决方案。由于极长的输入会引入过高的计算和内存开销,EMLoC 提出了一种分块压缩机制,并结合逐层自适应剪枝。它将长上下文多模态输入压缩为紧凑的、特定于任务的记忆表示。通过在 Jensen-Shannon 散度约束下逐层自适应剪枝 token,我们的方法在不牺牲性能的情况下大幅降低了推理复杂度。该方法首次将压缩和剪枝技术无缝集成于多模态长上下文学习,为实际应用提供了可扩展且高效的解决方案。在多样化视觉-语言基准上的广泛实验表明,EMLoC 实现了与朴素长上下文方法相当或更优的性能。我们的结果突出了 EMLoC 作为在资源受限环境中高效且灵活地适配多模态模型的开创性框架的潜力。代码公开于 https://github.com/Zehong-Ma/EMLoC。

关键词

引用

@article{arxiv.2505.19812,
  title  = {Efficient Multi-modal Long Context Learning for Training-free Adaptation},
  author = {Zehong Ma and Shiliang Zhang and Longhui Wei and Qi Tian},
  journal= {arXiv preprint arXiv:2505.19812},
  year   = {2025}
}

备注

Accepted to ICML2025