中文

PARCEL:用于高效视觉语言理解的池化锚定重采样与条件弹性查询

计算机视觉与模式识别 2026-05-29 v1 人工智能 计算与语言 机器学习

摘要

大型视觉语言模型 (LVLMs) 将视觉输入映射为稠密 token 序列,导致推理时的二次计算瓶颈。弹性视觉 token 压缩通过在单个模型上训练即可在多个视觉 token 预算下运行来解决此问题。然而,现有方法在激进压缩下表现不佳。仅进行空间压缩的嵌套池化行为类似于不完美的低通滤波器,导致谱混叠破坏细粒度细节。仅进行查询压缩的嵌套查询重采样用非局部摘要取代显式网格对齐 token,显著降低空间定位性能。为解决这种表征冲突,我们引入 PARCEL(Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding),一种动态划分特征提取职责的视觉 tokenization 架构。PARCEL 将空间池化 token 建立为低频布局锚点,并通过池化条件查询重采样使弹性查询 token 依赖于这些锚点。这鼓励查询 token 专注于互补的视觉特征而非冗余的空间映射。广泛的评估覆盖 27 个基准测试,表明 PARCEL 在性能-效率 Pareto 前沿上持续领先,跨越各种视觉 token 预算均优于现有 matryoshka 基线,同时保持“一次训练,随处部署”的范式。

关键词

引用

@article{arxiv.2605.30126,
  title  = {PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding},
  author = {Selim Kuzucu and Alessio Tonioni and Vasile Lup and Bernt Schiele and Federico Tombari and Muhammad Ferjad Naeem},
  journal= {arXiv preprint arXiv:2605.30126},
  year   = {2026}
}

备注

33 pages, 4 figures