中文

差分多模态转换器

人工智能 2025-07-23 v1 多媒体

摘要

小型语言模型因其高效性和日益提升的能力而获得了广泛流行。然而,融合额外模态(如视觉)会加剧受限上下文窗口的挑战,引入噪声。近期研究表明,Transformer 注意力机制常常过度关注无关的上下文。本文将原为文本模型设计的差分注意力机制扩展至文本-视觉模型 PaliGemma。旨在评估其减轻噪声信息检索并降低幻觉能力。为此,我们使用 LoRA 对 PaliGemma 3B 模型进行微调,纳入差分注意力,并实验不同的参数设置和配置。我们证明,差分注意力可以被适配和集成到现有模型的微调中,以增强噪声信息检索和问答能力。

关键词

引用

@article{arxiv.2507.15875,
  title  = {Differential Multimodal Transformers},
  author = {Jerry Li and Timothy Oh and Joseph Hoang and Vardhit Veeramachaneni},
  journal= {arXiv preprint arXiv:2507.15875},
  year   = {2025}
}