中文

大型语言模型仅通过阅读就隐式学会看见和听见

计算与语言 2025-09-24 v2 人工智能 计算机视觉与模式识别 机器学习 声音 音频与语音处理

摘要

本文提出了一个引人注目的发现:通过在文本标记上训练自回归LLM模型,文本模型会内在地发展出理解图像和音频的能力,从而发展出仅通过阅读就能看见和听见的能力。流行的音频和视觉LLM模型通过微调文本LLM模型来实现文本输出,这些输出基于图像和音频嵌入。相反,我们的架构接受图像块、音频波形或标记作为输入。它为我们提供了典型分类管道所需的嵌入或类别标签。我们展示了文本权重在FSD-50K和GTZAN数据集上帮助音频分类的通用性。进一步地,我们展示了在CIFAR-10和Fashion-MNIST上的图像分类以及图像块上的工作正常。这推动了文本LLM学习强大内部电路的概念,这些电路可以通过激活必要的连接来用于各种应用,而无需每次都从头训练模型。

关键词

引用

@article{arxiv.2505.17091,
  title  = {Large Language Models Implicitly Learn to See and Hear Just By Reading},
  author = {Prateek Verma and Mert Pilanci},
  journal= {arXiv preprint arXiv:2505.17091},
  year   = {2025}
}

备注

6 pages, 3 figures, 4 tables. Added BLIP reference