中文

基于对比学习的东盟语言跨语言词对齐

计算与语言 2024-07-09 v1

摘要

跨语言词对齐在各种自然语言处理任务中扮演着关键角色,尤其是对于低资源语言。最近的研究提出了一种基于BiLSTM的编码器-解码器模型,该模型在低资源设置下优于预训练语言模型。然而,他们的模型只考虑了词嵌入空间的相似性,并未显式建模词嵌入之间的差异。为解决这一局限性,我们提出将对比学习融入基于BiLSTM的编码器-解码器框架。我们的方法引入了一种多视角负采样策略,以学习共享跨语言嵌入空间中词对之间的差异。我们在五个涵盖四种东盟语言(老挝语、越南语、泰语和印度尼西亚语)的双语对齐数据集上评估了我们的模型。实验结果表明,整合对比学习在所有数据集上持续提高了词对齐准确率,证实了所提方法在低资源场景下的有效性。我们将发布我们的数据集和代码,以支持未来对东盟语言或更多低资源语言词对齐的研究。

关键词

引用

@article{arxiv.2407.05054,
  title  = {Cross-Lingual Word Alignment for ASEAN Languages with Contrastive Learning},
  author = {Jingshen Zhang and Xinying Qiu and Teng Shen and Wenyu Wang and Kailin Zhang and Wenhe Feng},
  journal= {arXiv preprint arXiv:2407.05054},
  year   = {2024}
}