用于改进 NLP 嵌入向量变换的语言模型度量与 Procrustes 分析
计算与语言
2021-06-07 v1 神经与进化计算
摘要
人工神经网络其核心为数学模型。这一事实在网络执行自然语言处理时带来某些根本性困难。一个关键问题在于度量 NLP 嵌入空间中向量间的相似度或距离,因为距离的数学概念并不总与语言学概念一致。我们建议度量向量间语言距离的最佳方式是使用生成它们的语言模型(LM)。我们引入语言模型距离(LMD)以基于分布假说度量向量变换的准确度(LMD 准确度)。我们通过将此度量应用于学习双语词映射 Procrustes 算法的简单神经网络来展示该度量的有效性。
引用
@article{arxiv.2106.02490,
title = {Language Model Metrics and Procrustes Analysis for Improved Vector Transformation of NLP Embeddings},
author = {Thomas Conley and Jugal Kalita},
journal= {arXiv preprint arXiv:2106.02490},
year = {2021}
}