量化经典与最先进嵌入的组合性
计算与语言
2025-09-25 v1 人工智能
摘要
为了让语言模型能正确泛化到新颖的表达,关键在于它们在合理的情况下利用组合意义。即使我们不知道“pelp”是什么,我们也可以利用我们对数字的知识来理解“ten pelps”比“two pelps”产生更多的pelps。静态词嵌入如Word2vec对组合性做出了强有力,甚至过度的断言。然而,最先进的生成式、Transformer模型和图模型则走向了另一个极端,没有对上下文引起的意义变化提供任何真正的限制。为了量化加性组合性,我们形式化了一个两步的通用评估方法:(i)通过典型相关分析测量已知实体属性与其嵌入之间的线性关系,以及(ii)通过重建未见属性组合的嵌入并检查L2损失、余弦相似度和检索准确率等重建指标,来评估加性泛化能力。这些指标还捕获了线性组合失效的失败案例。我们对句子、知识图谱和词嵌入进行了评估,并追踪了所有层和训练阶段的组合性。在跨数据模态的后期训练阶段,以及在基于Transformer模型的更深层(在顶层下降之前),观察到了更强的组合信号。代码可在https://github.com/Zhijin-Guo1/quantifying-compositionality获取。
引用
@article{arxiv.2509.19332,
title = {Quantifying Compositionality of Classic and State-of-the-Art Embeddings},
author = {Zhijin Guo and Chenhao Xue and Zhaozhen Xu and Hongbo Bo and Yuxuan Ye and Janet B. Pierrehumbert and Martha Lewis},
journal= {arXiv preprint arXiv:2509.19332},
year = {2025}
}
备注
Findings of the Association for Computational Linguistics: EMNLP 2025