ZeroSense:长上下文压缩中视觉的重要性
计算机视觉与模式识别
2026-03-13 v1
摘要
最近的视觉文本压缩 (VTC) 方法,如 DeepSeek-OCR,报告在利用文本到图像渲染实现长上下文建模任务时能够实现惊人的高 token 压缩比率。然而,现有的评估协议严重依赖下游任务性能。此类评估指标未能准确衡量文本保真度,因为多模态大语言模型 (MLLM) 具有强大的内在语言先验。本文引入新的评估框架,解耦 MLLM 的能力,以忠实评估 VTC 质量。在该框架内,我们进一步引入 ZeroSense 基准测试,以确保测试样本的语义相关性极低。通过消除上下文依赖,Our benchmark 保证评估结果纯粹反映 VTC 质量,不受下游模型语义推理能力的影响。跨多个数据集的大量实验表明,VTC 质量与下游任务准确率存在显著分离,凸显了我们解耦评估框架的必要性。
引用
@article{arxiv.2603.11846,
title = {ZeroSense:How Vision matters in Long Context Compression},
author = {Yonghan Gao and Zehong Chen and Lijian Xu and Jingzhi Chen and Jingwei Guan and Xingyu Zeng},
journal= {arXiv preprint arXiv:2603.11846},
year = {2026}
}