文本还是像素?视觉文本输入在多模态 LLM 中的 token 效率
计算与语言
2025-10-23 v2 人工智能
摘要
大语言模型(LLM)及其多模态变体现在可以处理视觉输入,包括文本图像。这引出了一个引人入胜的问题:我们能否通过将其作为图像来传递文本输入来减少 token 使用而不影响性能?本文显示,视觉文本表示是解码器 LLM 的一种实用且意想不到的有效输入压缩形式。我们利用将长文本渲染为单个图像并直接提供给模型的想法。这导致所需的解码器 token 数量大幅减少,提供了一种新的输入压缩形式。通过在两个不同的基准测试 RULER(长上下文检索)和 CNN/DailyMail(文档摘要)上的实验,我们证明了这种文本作为图像的方法在不损害任务性能的情况下可实现显著的 token 节省(通常接近一半)。
引用
@article{arxiv.2510.18279,
title = {Text or Pixels? It Takes Half: On the Token Efficiency of Visual Text Inputs in Multimodal LLMs},
author = {Yanhong Li and Zixuan Lan and Jiawei Zhou},
journal= {arXiv preprint arXiv:2510.18279},
year = {2025}
}
备注
Accepted to EMNLP 2025 Findings ("Text or Pixels? Evaluating Efficiency and Understanding of LLMs with Visual Text Inputs")