IITK的MCL系统在SemEval-2021任务2:利用增强数据、信号与Transformers的多语言及跨语言上下文词义消歧
计算与语言
2021-04-06 v1
摘要
在这项工作中,我们展示了解决SemEval 2021任务2:多语言与跨语言上下文词义消歧(MCL-WiC)的方法。该任务是一个句子对分类问题,目标是检测两个句子共有的给定词是否唤起相同含义。我们为两种设定提交了系统——多语言(句子对的句子属于同一语言)和跨语言(句子对的句子属于不同语言)。训练数据仅以英语提供。因此,我们采用了跨语言迁移技术。我们的方法对基于transformer的预训练语言模型(如英语任务的ELECTRA和ALBERT,以及其他所有任务的XLM-R)进行微调。为提升这些系统的性能,我们提出向待消歧词添加信号,并通过句子对反转来增强数据。我们进一步用WiC、XL-WiC和SemCor 3.0扩充提供给我们的数据集。通过集成,我们在多语言任务中取得强劲表现,在EN-EN和FR-FR子任务中排名第一。对于跨语言设定,我们采用了翻译-测试方法以及使用我们多语言模型的零样本方法,后者表现略好。
引用
@article{arxiv.2104.01567,
title = {MCL@IITK at SemEval-2021 Task 2: Multilingual and Cross-lingual Word-in-Context Disambiguation using Augmented Data, Signals, and Transformers},
author = {Rohan Gupta and Jay Mundra and Deepak Mahajan and Ashutosh Modi},
journal= {arXiv preprint arXiv:2104.01567},
year = {2021}
}
备注
Accepted at SemEval 2021 Task 2, 10 Pages (8 Pages main content+ 2 pages for references)