中文

视频生成模型在地理上公平吗?面向全球视觉知识的景点中心评估

计算机视觉与模式识别 2026-01-27 v1

摘要

文本到视频生成的最新进展产生了视觉上令人信服的结果,然而这些模型是否编码了地理上公平的视觉知识仍不清楚。在本工作中,我们通过以景点为中心的评估,研究了文本到视频模型的地理公平性和地理锚定的视觉知识。我们引入了 Geo-Attraction Landmark Probing (GAP),这是一个系统框架,用于评估模型如何忠实地合成来自不同地区的旅游景点,并构建了 GEOATTRACTION-500,这是一个包含 500 个全球分布景点的基准,涵盖不同的地区和受欢迎程度。GAP 整合了互补的指标,将整体视频质量与特定景点的知识分离开来,包括全局结构对齐、基于细粒度关键点的对齐以及视觉语言模型判断,所有指标均经过人类评估验证。将 GAP 应用于最先进的文本到视频模型 Sora 2,我们发现,与普遍认为的强烈地理偏差假设相反,该模型在不同地区、发展水平和文化群体中表现出相对均匀的地理锚定视觉知识水平,且对景点受欢迎程度的依赖性较弱。这些结果表明,当前的文本到视频模型表达全球视觉知识的均匀程度超出预期,突显了它们在全球部署应用中的前景,以及随着此类系统演进持续评估的必要性。

关键词

引用

@article{arxiv.2601.18698,
  title  = {Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge},
  author = {Xiao Liu and Jiawei Zhang},
  journal= {arXiv preprint arXiv:2601.18698},
  year   = {2026}
}

备注

Work in progress