超越记忆:暴露视觉语言模型中流行偏差的多模态序数回归基准
计算机视觉与模式识别
2025-12-25 v1
摘要
我们暴露了state-of-the-art视觉语言模型(VLMs)中的显著流行偏差,这些模型在著名建筑上的准确率比普通建筑高最高可达34%,表明其依赖于记忆而非可泛化的理解。为系统性地调查这一问题,我们引入了最大开放基准:YearGuessr数据集,这是一个包含55,546张建筑图片的集合,具有来自157个国家的多模态属性,标注为其建筑年代的连续序数标签(1001-2024),GPS数据以及作为流行度代理变量的页面浏览次数。使用该数据集,我们将建筑年代预测任务建模为序数回归,并引入基于流行度的区间准确度指标来量化这一偏差。我们结果基准包括30多个模型,其中包括我们的YearCLIP模型,确认VLMs在流行、被记忆的项目上表现出色,但在不被识别的主题上表现严重受限,暴露了其推理能力的关键缺陷。项目页面:https://sytwu.github.io/BeyondMemo/
关键词
引用
@article{arxiv.2512.21337,
title = {Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models},
author = {Li-Zhong Szu-Tu and Ting-Lin Wu and Chia-Jui Chang and He Syu and Yu-Lun Liu},
journal= {arXiv preprint arXiv:2512.21337},
year = {2025}
}
备注
Project page: https://sytwu.github.io/BeyondMemo/