中文

ASCIIEval:通过 ASCII 艺术评估模型在文本字符串中的视觉感知能力

计算与语言 2025-09-26 v2

摘要

感知嵌入在连续字符中的视觉语义是大型语言模型(LLM)和多模态大型语言模型(MLLM)的关键且尚未充分探索的能力。本文选取 ASCII 艺术作为代表性样品。它通过精心排列字符来描绘概念,可在文本和图像两种模态中进行建模。我们将问题定义为识别任务,构建了一个新的基准测试 ASCIIEval。其覆盖超过 3000 个样本,配有精细的分类树,并附带训练集以供进一步提升。通过不同输入模态对数十个模型进行全面分析,我们的基准展示出多方位的诊断能力。当以文本输入时,语言模型展现了在 ASCII 艺术概念上的视觉感知能力。专有模型在某些类别中取得超过 70% 的准确率,GPT-5 位居榜首。对于图像输入,我们发现开源 MLLM 在细粒度文本识别与整体视觉感知之间存在权衡。它们对这种特殊类型的艺术品的泛化能力有限,准确率与专有模型相比差距超过 20.01%。另一个关键发现是,模型性能对 ASCII 艺术的长度敏感,且这种敏感性在不同输入模态下呈现差异。不幸的是,无论是文本还是图像输入,都没有任何模型能够成功利用同时提供的两种模态,凸显了需要更灵活的模态融合方法的需求。此外,我们还介绍了进一步提升的方法并讨论了未来方向。资源已公开于 https://github.com/JiaQiSJTU/VisionInText。

关键词

引用

@article{arxiv.2410.01733,
  title  = {ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art},
  author = {Qi Jia and Xiang Yue and Shanshan Huang and Ziheng Qin and Yizhu Liu and Bill Yuchen Lin and Yang You and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2410.01733},
  year   = {2025}
}