HIRE:面向多模态 LLM 的轻量级高分辨率图像特征增强
计算机视觉与模式识别
2025-06-24 v1
摘要
在现代多模态大语言模型中集成高分辨率图像特征,已在细粒度视觉理解任务中展现出显著的性能提升,并在多个基准测试中取得了高性能。由于这些特征是从 ViT 等大型图像编码器中获取的,多次调用这些编码器导致计算成本显著增加。在本工作中,我们首先建立了将特征上采样视为高分辨率特征生成的自然延伸的直觉。通过大量实验与消融研究,我们证明了浅层特征增强器能够取得具有竞争力的结果,同时在训练和推理时间以及计算成本上实现了大幅降低,FLOPs 最多可节省 1.5 倍。
引用
@article{arxiv.2506.17608,
title = {HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs},
author = {Nikitha SR and Aradhya Neeraj Mathur and Tarun Ram Menta and Rishabh Jain and Mausoom Sarkar},
journal= {arXiv preprint arXiv:2506.17608},
year = {2025}
}
备注
Accepted in CVPR 2025 Workshop on What's Next in Multimodal Foundational Models