差分多模态转换器
人工智能
2025-07-23 v1 多媒体
摘要
小型语言模型因其高效性和日益提升的能力而获得了广泛流行。然而,融合额外模态(如视觉)会加剧受限上下文窗口的挑战,引入噪声。近期研究表明,Transformer 注意力机制常常过度关注无关的上下文。本文将原为文本模型设计的差分注意力机制扩展至文本-视觉模型 PaliGemma。旨在评估其减轻噪声信息检索并降低幻觉能力。为此,我们使用 LoRA 对 PaliGemma 3B 模型进行微调,纳入差分注意力,并实验不同的参数设置和配置。我们证明,差分注意力可以被适配和集成到现有模型的微调中,以增强噪声信息检索和问答能力。
引用
@article{arxiv.2507.15875,
title = {Differential Multimodal Transformers},
author = {Jerry Li and Timothy Oh and Joseph Hoang and Vardhit Veeramachaneni},
journal= {arXiv preprint arXiv:2507.15875},
year = {2025}
}