构建式畸变:利用注意力引导的图像扭曲改进多模态大语言模型
计算机视觉与模式识别
2026-04-21 v3 机器学习
摘要
多模态大语言模型(Multimodal Large Language Models, MLLMs)在复杂场景中常常遗漏小细节和空间关系,导致细粒度感知定位出现错误。我们提出 AttWarp,一种轻量级方法,在保留全局上下文的同时,将更多分辨率分配给与查询相关的内容,并压缩信息量较少的区域。在测试阶段,该方法利用多模态大语言模型的跨模态注意力对输入图像进行直线畸变,将空间分辨率重新分配至模型认为重要的区域,且无需更改模型权重或架构。这种注意力引导的畸变保留了所有原始图像信息,但对其进行非均匀重分配,使小目标和细微关系对同一模型而言更易于读取,同时保持全局布局完整。在五个基准(TextVQA、GQA、DocVQA、POPE、MMMU)和四个多模态大语言模型(LLaVA、Qwen-VL、InternVL、InstructBLIP)上的实验表明,AttWarp 持续提升准确率,增强组合推理能力,并减少幻觉,优于四种在测试时操作原始图像的竞争基线。综上,这些结果表明,注意力引导的畸变在保留上下文的同时优先处理与查询相关的信息,并且同一多模态大语言模型在接收此类畸变输入时表现更佳。
引用
@article{arxiv.2510.09741,
title = {Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping},
author = {Dwip Dalal and Gautam Vashishtha and Utkarsh Mishra and Jeonghwan Kim and Madhav Kanda and Hyeonjeong Ha and Svetlana Lazebnik and Heng Ji and Unnat Jain},
journal= {arXiv preprint arXiv:2510.09741},
year = {2026}
}
备注
Accepted at ICLR 2026