基于多语言对抗训练与侧抑制的罗马尼亚语多词表达式检测
计算与语言
2023-05-09 v2
摘要
多词表达式是为开发大规模且语言学上严谨的自然语言处理技术的关键要素。本文描述了我们在 PARSEME v1.2 共享任务所发布语料上自动识别罗马尼亚语多词表达式方面的改进。我们的方法基于最近引入的侧抑制层(lateral inhibition layer)和对抗训练,采取多语言视角,以提升所采用的多语言语言模型的性能。借助这两种方法,我们在未见多词表达式(PARSEME 1.2 版本的主要任务)上将 XLM-RoBERTa 的 F1 分数提高了约 2.7%。此外,我们的结果可被视为 SOTA 性能,因为它们超越了该竞赛参与者此前在罗马尼亚语上取得的成绩。
引用
@article{arxiv.2304.11350,
title = {Romanian Multiword Expression Detection Using Multilingual Adversarial Training and Lateral Inhibition},
author = {Andrei-Marius Avram and Verginica Barbu Mititelu and Dumitru-Clementin Cercel},
journal= {arXiv preprint arXiv:2304.11350},
year = {2023}
}
备注
Accepted at the 19th Workshop on Multiword Expressions (MWE 2023). The arxiv version contains some minor corrections