中文

子对象级图像分词

计算机视觉与模式识别 2025-03-14 v3 计算与语言

摘要

基于补丁的图像分词忽略了视觉世界的形态,限制了图像理解的有效和高效学习。受子词分词的启发,我们引入了子对象级自适应分词分割,并探索了多种方法,包括超像素、SAM 以及我们提出的高效全景优化(EPOC)图像分词器。我们的 EPOC 结合了边界检测(这是一项可以由紧凑模型很好处理的简单任务)与分水岭分割,后者固有地保证了没有像素未被分割。在 5 个数据集上的内在评估表明,EPOC 的分割与人类对对象级和部件级视觉形态的标注非常吻合,产生了更多单义分词,并提供了显著的效率优势。对于外在评估,我们设计了一种处理任意形状分词的嵌入,并在 4 个对象识别和详细描述数据集上使用不同的分词器训练了 VLM。结果表明,子对象分词能够在使用更少视觉分词的情况下实现更快的收敛和更好的泛化能力。

关键词

引用

@article{arxiv.2402.14327,
  title  = {Subobject-level Image Tokenization},
  author = {Delong Chen and Samuel Cahyawijaya and Jianfeng Liu and Baoyuan Wang and Pascale Fung},
  journal= {arXiv preprint arXiv:2402.14327},
  year   = {2025}
}