中文

深度文本与图像表示中语义信息的量化分析

计算与语言 2026-05-14 v6 机器学习 计算物理

摘要

最近观察到,处理相同或语义相关输入的不同模型的表示倾向于对齐。我们采用信息不平衡(Information Imbalance)——一种基于秩的非对称度量,用于量化表示对另一表示的预测能力,提供可在高维空间中高效计算的交叉熵代理。通过测量 DeepSeek-V3 处理翻译生成的表示之间的信息不平衡,我们发现语义信息分布在多个标记(token)中,语义可预测性在网络的中央层最为强烈,这种可预测性在六种语言对之间保持稳定。我们测量到清晰的信息不对称:英文表示系统性地比其他语言更具预测性;DeepSeek-V3 的表示对更小的模型(如 Llama3-8b)的表示具有更强的预测性,而反之则不然。在视觉领域,我们观察到语义信息在自回归模型中集中于中间层,在编码器模型中集中于最终层,而这些层同样提供了与图像标题文本表示之间最强的跨模态可预测性。我们的结果支持语义在语言、模态和架构之间趋同的假设,同时显示,给定表示之间的定向可预测性随层级深度、模型规模和语言的变化而显著变化。

关键词

引用

@article{arxiv.2505.17101,
  title  = {A quantitative analysis of semantic information in deep representations of text and images},
  author = {Santiago Acevedo and Andrea Mascaretti and Riccardo Rende and Matéo Mahaut and Marco Baroni and Alessandro Laio},
  journal= {arXiv preprint arXiv:2505.17101},
  year   = {2026}
}