合成感知:生成图像能否解锁以文本为中心推理的潜在视觉先验?
多媒体
2026-03-04 v2 计算机视觉与模式识别
摘要
在大量纯文本数据与日益强大的多模态模型之间存在着显著的“模态鸿沟”。这项工作系统地研究了由文本到图像(T2I)模型即时生成的图像能否作为一种机制,解锁以文本为中心推理的潜在视觉先验。通过在文本分类上的综合评估框架,我们分析了关键变量的影响,包括 T2I 模型质量(例如 Flux.1、SDXL)、提示工程策略以及多模态融合架构。我们的研究结果表明,这种“合成感知”可以通过有效地将文本投射到视觉语义空间中,带来显著的性能提升,即使在增强 Llama-3 和 Qwen-2.5 等强大的大语言模型基线时也是如此。我们表明,这种方法作为一种跨模态探测形式,缓解了纯文本训练中固有的感官剥夺。然而,其有效性高度取决于文本与生成图像之间的语义对齐、任务的视觉可奠基性以及 T2I 模型的生成保真度。我们的工作为这一范式建立了严格的基准,证明了其作为在传统单模态场景中丰富语言理解途径的可行性。
引用
@article{arxiv.2506.17623,
title = {Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?},
author = {Yuesheng Huang and Peng Zhang and Xiaoxin Wu and Riliang Liu and Jiaqi Liang},
journal= {arXiv preprint arXiv:2506.17623},
year = {2026}
}
备注
Accepted as a poster at the International Conference on Machine Learning (ICML 2025) NewInML Workshop