中文

解锁潜在画布:在 LLM 中挖掘和基准测试符号视觉表达

计算机视觉与模式识别 2026-03-17 v1

摘要

当前的多模态方法主要将视觉生成视为外部过程,依赖像素渲染或代码执行,忽略了大型语言模型 (LLM) 内部固有的视觉表示能力。本文通过 ASCII 艺术,一种紧凑、高效且以文本为本质的视觉格式,挖掘了这种潜能。我们引入 SVE-ASCII,一个旨在纯文本空间中挖掘和基准测试符号视觉表达的统一框架。为解决系统资源稀缺的问题,我们构建了 ASCIIArt-7K 数据集,通过一种新颖的「种子-演化」管道合成,增强了通过上下文风格编辑所创建的人类精选锚点。我们进一步实施了统一的指令调优策略,同时优化生成(文本到 ASCII)和理解(ASCII 到文本)。关键的是,我们的实验揭示了关于任务二元性的关键现象:虽然已确立感知有助于生成,但我们提供了 compelling 证据表明生成性训练显著提升视觉理解。这确认了符号视觉处理中一种相互强化的循环,这种关系此前仅有假设而在视觉领域鲜有实证。我们公开了数据集、ASCIIArt-Bench 基准测试以及 SVE-ASCII 模型,为本地文本式视觉智能建立了稳健的基准。

关键词

引用

@article{arxiv.2603.14505,
  title  = {Unlocking the Latent Canvas: Eliciting and Benchmarking Symbolic Visual Expression in LLMs},
  author = {Yiren Zheng and Shibo Li and Jiaming Liu and Haofan Wang and Yiren Song},
  journal= {arXiv preprint arXiv:2603.14505},
  year   = {2026}
}