单词嵌入中的线性类比的出现
计算与语言
2025-10-24 v2 无序系统与神经网络
机器学习
摘要
诸如 Word2Vec 和 GloVe 的模型基于单词在语料库中共现概率 构建单词嵌入。得到的向量 不仅将语义相似的单词聚在一起,还表现出一种显著的线性类比结构——例如, ——其理论来源尚不明确。先前的观察表明,这一类比结构:(i)已在矩阵 的前导特征向量中出现;(ii)随着更多包含 的特征向量(控制嵌入维度)被纳入,逐渐加强并最终饱和;(iii)使用 而非 可增强这一结构;(iv)即使删除语料库中涉及特定类比关系(如国王-后女王、男人-女人)的所有单词对,仍然存在这一结构。为解释这些现象,我们引入一种理论生成模型,其中将单词定义为二进制语义属性,并从属性基础的相互作用中推导共现概率。该模型在分析上再现了线性类比结构的出现,并自然解释了现象 (i)-(iv)。它可被视为对每个额外嵌入维度在类比结构中作用的细粒度解释。它对各种噪声形式都稳健,并与维基百科和Mikolov 等人引入的类比基准测试中测量的共现统计数据良好一致。
引用
@article{arxiv.2505.18651,
title = {On the Emergence of Linear Analogies in Word Embeddings},
author = {Daniel J. Korchinski and Dhruva Karkada and Yasaman Bahri and Matthieu Wyart},
journal= {arXiv preprint arXiv:2505.18651},
year = {2025}
}
备注
Main: 10 pages, 3 figures. Appendices: 11 pages, 7 figures. Accepted at NeurIPS 2025 as a poster