在视觉-语言模型中融合频域表示与低秩适配
计算机视觉与模式识别
2025-03-11 v1
摘要
态势感知应用严重依赖对视觉和文本数据的实时处理以提供可操作的见解。视觉-语言模型(VLMs)通过将视觉输入与自然语言描述相连接,已成为解释复杂环境的重要工具。然而,这些模型经常面临计算挑战,特别是在要求其在真实环境中高效执行时。本研究提出了一种新颖的视觉-语言模型(VLM)框架,该框架利用频域变换和低秩适配(LoRA)来增强特征提取、可扩展性和效率。与仅依赖空间域表示的传统 VLMs 不同,我们的方法结合了基于离散傅里叶变换(DFT)的低秩特征,同时保留了预训练的空间权重,从而在嘈杂或低能见度场景中实现稳健的性能。我们在具有不同级别高斯噪声的基准数据集上,对所提出的模型在图像描述生成和视觉问答(VQA)任务上进行了评估。定量结果表明,我们的模型取得了与 CLIP ViT-L/14 和 SigLIP 等最先进 VLMs 相当的评估指标。定性分析进一步表明,我们的模型提供了更详细且与上下文更相关的响应,特别是对于由安装在无人地面车辆(UGV)上的 RealSense 相机捕获的真实世界图像。
引用
@article{arxiv.2503.06003,
title = {Integrating Frequency-Domain Representations with Low-Rank Adaptation in Vision-Language Models},
author = {Md Azim Khan and Aryya Gangopadhyay and Jianwu Wang and Robert F. Erbacher},
journal= {arXiv preprint arXiv:2503.06003},
year = {2025}
}
备注
8 pages, 4 figures