中文

通过图像提示打包实现令牌高效的多模态推理

计算机视觉与模式识别 2026-04-06 v1 人工智能

摘要

大规模部署多模态语言模型受限于基于 token 的推理成本,而视觉提示策略的成本效益行为仍未得到良好 characterization。我们引入图像提示打包 (IPPg),这是一种将结构化文本嵌入图像以减少文本 token 开销的提示范例,并在五个数据集、三个前沿模型 (GPT-4.1、GPT-4o、Claude 3.5 Sonnet) 和两个任务族 (VQA 和代码生成) 上进行基准测试。我们推导了分解各类 token 节省量的成本公式,表明 IPPg 可实现 35.8--91.0% 的推理成本降低。尽管 token 压缩比高达 96%,但在许多情境下仍保持竞争力,尽管结果在模型和任务方面高度依赖:GPT-4.1 在 CoSQL 上实现了准确率和成本的同步提升,而 Claude 3.5 在多个 VQA 基准测试中则导致成本增加。系统性错误分析揭示了失效模式分类:空间推理、非英语输入和字符敏感操作最脆弱,而模式结构化任务受益最大。125 种配置的渲染消除实验显示准确率变化 10--30 个百分点,确立视觉编码选择作为多模态系统设计的首要变量。

关键词

引用

@article{arxiv.2604.02492,
  title  = {Token-Efficient Multimodal Reasoning via Image Prompt Packaging},
  author = {Joong Ho Choi and Jiayang Zhao and Avani Appalla and Himansh Mukesh and Dhwanil Vasani and Boyi Qian},
  journal= {arXiv preprint arXiv:2604.02492},
  year   = {2026}
}

备注

9 pages including references