PixelWorld:我们离将一切视为像素还有多远?
计算机视觉与模式识别
2025-10-23 v3 计算与语言
摘要
最近的智能体语言模型越来越多地需要与包含紧密交织的视觉和文本信息的现实世界环境交互,通常通过原始相机像素而不是单独处理的图像和分词文本。这种转变凸显了对统一感知范式的需求。为了研究这一想法,我们探索了“将一切视为像素”(PEAP)并引入了PixelWorld,这是一个将自然语言、表格、数学和图表输入渲染到共享像素空间的基准。跨多个基准的实验表明,PEAP在语义理解任务上实现了与基于分词方法相当的性能,表明视觉变换器可以在没有显式分词的情况下部分捕获全局文本语义。相比之下,数学和代码等推理密集型任务显示出显著的性能下降,尽管思维链提示通过补偿缺失的符号结构有助于缩小这一差距。我们进一步发现,当视觉和文本信息紧密集成时,将一切表示为像素简化了预处理并避免了跨模态错位。因此,PixelWorld为评估统一的视觉-语言模型提供了一个系统且实用的框架,并促进了对基于像素的多模态学习的进一步探索。
引用
@article{arxiv.2501.19339,
title = {PixelWorld: How Far Are We from Perceiving Everything as Pixels?},
author = {Zhiheng Lyu and Xueguang Ma and Wenhu Chen},
journal= {arXiv preprint arXiv:2501.19339},
year = {2025}
}