提高视觉增强语言模型的效率
计算与语言
2026-03-10 v3 人工智能
摘要
尽管自回归语言模型(Language Models, LMs)性能令人印象深刻,但已有研究表明,由于报告偏差,LMs 缺乏视觉知识,即它们对视觉世界及其属性了解不多。为了用视觉知识增强 LMs,现有解决方案通常依赖于显式图像,这需要耗时的检索或图像生成系统。本文表明,显式图像对于视觉增强 LM 并非必要。相反,我们使用从著名的 CLIP 多模态系统获得的视觉基础文本表示。为了公平比较,我们修改了使用图像检索和表示的视觉增强 LM VALM,使其直接与视觉基础文本表示一起工作。我们将这个新模型命名为 BLIND-VALM。我们表明,尽管 BLIND-VALM 显著更高效、更简单,但在视觉语言理解(VLU)、自然语言理解(NLU)和语言建模任务上,其性能与 VALM 相当。我们还表明,在 VALM 的计算预算内扩展我们的模型,无论是增加模型规模还是预训练语料库大小,我们都能在所有评估任务上超越 VALM。
引用
@article{arxiv.2409.11148,
title = {Improving the Efficiency of Visually Augmented Language Models},
author = {Paula Ontalvilla and Aitor Ormazabal and Gorka Azkune},
journal= {arXiv preprint arXiv:2409.11148},
year = {2026}
}
备注
COLING 2025