关于Wasserstein-Procrustes在无监督跨语言学习中的一种新颖应用
计算与语言
2024-06-18 v2 机器学习
机器学习
摘要
在无监督词嵌入(基于极大型单语文本语料库预训练)上的涌现,是自然语言处理(NLP)当前神经革命的核心。此类预训练词嵌入最初为英语引入,随后迅速出现于多种其他语言。接着,已有诸多尝试用于对齐跨语言的嵌入空间,从而支持若干跨语言NLP应用。使用无监督跨语言学习(UCL)进行对齐尤其具有吸引力,因其所需数据极少且常可与有监督及半监督方法媲美。本文中,我们分析流行的UCL方法,发现它们的目标函数本质上常是Wasserstein-Procrustes问题的变体。因此,我们设计了一种直接求解Wasserstein-Procrustes的方法,可用于精炼并改进如迭代最近点(ICP)、多语言无监督与有监督嵌入(MUSE)及有监督Procrustes等流行UCL方法。我们在标准数据集上的评估实验显示相较这些方法有可观提升。我们相信,对Wasserstein-Procrustes问题的重新思考可推动进一步研究,从而助力开发更好的跨语言词嵌入对齐算法。用于复现实验的代码与说明见 https://github.com/guillemram97/wp-hungarian。
引用
@article{arxiv.2007.09456,
title = {On a Novel Application of Wasserstein-Procrustes for Unsupervised Cross-Lingual Learning},
author = {Guillem Ramírez and Rumen Dangovski and Preslav Nakov and Marin Soljačić},
journal= {arXiv preprint arXiv:2007.09456},
year = {2024}
}