中文

不止于眼见:通过语义锚定衡量视觉语言模型中的半语义鸿沟

计算与语言 2026-04-21 v1 计算机视觉与模式识别

摘要

视觉语言模型在逼真的图像生成方面表现出色,但常在表示抽象意义方面受限,例如名词复合词的习语性解释。为研究是否高视觉保真度干扰习语性组合性质于视觉抽象化,我们引入DIVA,一个受控基准,将高保真视觉细节替换为图示化图式,通过为字面和习语读法生成配对、sense-anchored 可视化来实现。我们进一步提出语义错位差 (Δ\Delta),一种无架构依赖的指标,用于量化字面和习语视觉对齐之间的差异。我们引入方向性符号偏差 b(t)b(t),单独衡量字面偏好的方向和强度。评估8个最新视觉语言模型,揭示了持续的字面优势偏差:模型规模本身无法解决字面偏好,增加的视觉保真度与较弱的符号对齐相关,暗示了来自超高保真图像的认知干扰。我们的发现表明,改进组合理解需要对视觉输入进行图示化抽象化,并将解释和生成锚定在预期意义上。

关键词

引用

@article{arxiv.2604.17354,
  title  = {More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage},
  author = {Wei He},
  journal= {arXiv preprint arXiv:2604.17354},
  year   = {2026}
}

备注

16 pages, 4 figures. Accepted to the Main Conference of ACL 2026