中文

潜在空间的动物行为学

计算机与社会 2026-02-06 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

本研究从动物行为学视角挑战视觉语言模型(VLMs)中潜在空间的中性假设。潜在空间并非均匀的确定性空间,而是呈现出模型特定的算法敏感性,即由训练数据和架构选择塑造的感知显著性差异。通过对三款模型(OpenAI CLIP、OpenCLIP LAION、SigLIP)针对15至20世纪301件艺术作品的比较分析,我们发现对政治和文化类别归因存在显著差异。运用由向量类比(Mikolov等,2013)导出的双极语义轴,我们发现SigLIP将59.4%的艺术作品归类为政治参与作品,而OpenAI CLIP仅为4%。非洲面具在SigLIP中获得最高的政治分数,但在OpenAI CLIP中则为无政治属性。在审美殖民轴上,模型间的差异可达72.6个百分点。我们提出三种操作性概念:计算潜在政治化,描述政治类别在无意编码情况下出现的现象;新兴偏好,无法归约为统计或规范偏好,仅通过对比分析才能被检测到;以及三种算法学术规范体制:熵型(LAION)、制度型(OpenAI)和半导体型(SigLIP),这些体制构成了不同可见性模式。我们借鉴福柯的档案概念、詹姆森的意识形语料,以及西蒙杜的 individuation 理论,论证训练数据集作为准档案,其话语结构在潜在空间中结晶。本工作促进了对VLMs应用于数字艺术史条件的批判性再评估,呼吁整合学习架构于文化解释算法代理的委托中。

关键词

引用

@article{arxiv.2602.05710,
  title  = {Ethology of Latent Spaces},
  author = {Philippe Boisnard},
  journal= {arXiv preprint arXiv:2602.05710},
  year   = {2026}
}

备注

23. pages, 14 figures, presented Hyperheritage International Symposium 9 ( https://paragraphe.univ-paris8.fr/IMG/pdf/programme_colloque_his9_campuscondorcet_v3.pdf ) and accepted for publication in double-blind peer review in French in 2026-2027