中文

单词嵌入中的线性类比的出现

计算与语言 2025-10-24 v2 无序系统与神经网络 机器学习

摘要

诸如 Word2Vec 和 GloVe 的模型基于单词在语料库中共现概率 P(i,j)P(i,j) 构建单词嵌入。得到的向量 WiW_i 不仅将语义相似的单词聚在一起,还表现出一种显著的线性类比结构——例如,WkingWman+WwomanWqueenW_{\text{king}} - W_{\text{man}} + W_{\text{woman}} \approx W_{\text{queen}} ——其理论来源尚不明确。先前的观察表明,这一类比结构:(i)已在矩阵 M(i,j)=P(i,j)/P(i)P(j)M(i,j) = P(i,j)/P(i)P(j) 的前导特征向量中出现;(ii)随着更多包含 M(i,j)M (i, j) 的特征向量(控制嵌入维度)被纳入,逐渐加强并最终饱和;(iii)使用 logM(i,j)\log M(i,j) 而非 M(i,j)M(i,j) 可增强这一结构;(iv)即使删除语料库中涉及特定类比关系(如国王-后女王、男人-女人)的所有单词对,仍然存在这一结构。为解释这些现象,我们引入一种理论生成模型,其中将单词定义为二进制语义属性,并从属性基础的相互作用中推导共现概率。该模型在分析上再现了线性类比结构的出现,并自然解释了现象 (i)-(iv)。它可被视为对每个额外嵌入维度在类比结构中作用的细粒度解释。它对各种噪声形式都稳健,并与维基百科和Mikolov 等人引入的类比基准测试中测量的共现统计数据良好一致。

关键词

引用

@article{arxiv.2505.18651,
  title  = {On the Emergence of Linear Analogies in Word Embeddings},
  author = {Daniel J. Korchinski and Dhruva Karkada and Yasaman Bahri and Matthieu Wyart},
  journal= {arXiv preprint arXiv:2505.18651},
  year   = {2025}
}

备注

Main: 10 pages, 3 figures. Appendices: 11 pages, 7 figures. Accepted at NeurIPS 2025 as a poster