通过自适应对比三元组损失增强多语言习语表示
计算与语言
2024-09-06 v1 人工智能
摘要
准确建模习语性或非组合性语言一直是自然语言处理(NLP)中的一个长期挑战。这部分是因为这些表达的含义并非仅由其组成词推导而来,也由于相关数据资源的稀缺性,以及它们对机器翻译和简化等下游任务性能的影响。在本文中,我们提出了一种有效建模习语性的方法,该方法使用三元组损失,通过自适应对比学习和重采样挖掘器,将组成词对习语含义的非对称贡献纳入语言模型的训练目标中。我们提出的方法在SemEval挑战任务上进行了评估,并在许多指标上显著优于之前的替代方案。
引用
@article{arxiv.2406.15175,
title = {Enhancing Idiomatic Representation in Multiple Languages via an Adaptive Contrastive Triplet Loss},
author = {Wei He and Marco Idiart and Carolina Scarton and Aline Villavicencio},
journal= {arXiv preprint arXiv:2406.15175},
year = {2024}
}