中文

基于意大利语 CoLA 语料库的单语与跨语可接受性判断

计算与语言 2022-10-14 v1

摘要

自动化语言可接受性方法的发展极大受益于英语 CoLA 语料库的可用,该语料库也被纳入广泛使用的 GLUE 基准。然而,针对英语以外语言的此类研究,以及跨语言方法的分析,因缺乏其他语言中规模可比的资源而受阻。因此我们开发了 ItaCoLA 语料库,包含近 10,000 条带可接受性判断的句子,其创建遵循与英语语料库相同的方法与步骤。本文中我们描述语料库创建过程,详述其内容,并呈现对该新资源的首批实验。我们比较了域内与域外分类,并对九种语言现象进行了专项评估。我们还呈现了首批跨语言实验,旨在评估基于多语 Transformer 的方法能否在微调期间通过使用两种语言的句子而获益。

关键词

引用

@article{arxiv.2109.12053,
  title  = {Monolingual and Cross-Lingual Acceptability Judgments with the Italian CoLA corpus},
  author = {Daniela Trotta and Raffaele Guarasci and Elisa Leonardelli and Sara Tonelli},
  journal= {arXiv preprint arXiv:2109.12053},
  year   = {2022}
}

备注

Findings of EMNLP 2021. Dataset available at https://github.com/dhfbk/ItaCoLA-dataset