BLI 作为对齐度量的优劣:在词嵌入范式中的研究
摘要
除了少数来自 low-resource 领域的 monolingual embedding 研究之外,multilingual embedding 已成为事实上的选择,因为它适用于 code-mixed 语言的使用,能够以 language-agnostic manner 处理 multilingual 文档,同时消除对 monolingual embeddings 对齐的困难任务。但这种胜利是否完整?multilingual 模型在每个方面都比对齐的 monolingual 模型更好吗?更高的计算成本是否总是值得?或者是否存在两种极端之间的折中?Bilingual Lexicon Induction 是评估两个 embedding 空间对齐程度最广泛使用的指标之一。本研究探讨了 BLI 作为评估两个 embedding 空间对齐程度度量的优势和局限性。进一步,我们评估了传统 embedding 对齐技术、novel multilingual 模型和组合对齐技术在 high-resource 和 low-resource 语言情境中的 BLI 任务性能。除了此之外,我们还调查了语言家族对语言对所属关系的影响。我们指出,在某些情况下 BLI 并不衡量嵌入的真实对齐程度,并提出相应解决方案。我们提出了一种新颖的基于鞘的 BLI 方法,用于评估两个对齐 embedding 空间,考虑到语言的屈折性质,而与流行的基于单词的 BLI 技术不同。此外,我们引入一种更具信息性的词表修剪技术,尤其适用于 multilingual embedding 模型进行 BLI。 often,组合 embedding 对齐技术表现更好,但在某些情况下 multilingual embeddings 更好(主要是 low-resource 语言情况)。
引用
@article{arxiv.2511.13040,
title = {How Good is BLI as an Alignment Measure: A Study in Word Embedding Paradigm},
author = {Kasun Wickramasinghe and Nisansa de Silva},
journal= {arXiv preprint arXiv:2511.13040},
year = {2025}
}
备注
15 pages, 2 figures, 6 tables