视觉语言模型中文本可读性的涌现
计算机视觉与模式识别
2025-06-25 v1
摘要
我们研究了在训练视觉语言模型(VLMs)期间,识别图像中文本内容的能力是如何涌现的。我们的分析揭示了一个关键现象:文本可读性(text readability)在大量训练迭代后突然出现,与语义内容理解不同,后者从训练早期阶段逐渐发展。这种延迟的涌现可能反映了对比学习倾向于最初优先处理通用语义理解,文本专用符号处理随后发展。有趣的是,匹配带有渲染文本的图像的能力发展得更慢,表明需要更深入的语义集成。这些发现凸显了针对VLMs加速稳健文本理解所需的定制化训练策略的需求,为优化多模态学习的未来研究奠定了基础。
引用
@article{arxiv.2506.19389,
title = {Emergence of Text Readability in Vision Language Models},
author = {Jaeyoo Park and Sanghyuk Chun and Wonjae Kim and Sangdoo Yun and Bohyung Han},
journal= {arXiv preprint arXiv:2506.19389},
year = {2025}
}
备注
EVAL-FoMo Workshop @ CVPR 2025