中文

MELA:语言可接受性的多语言评估

计算与语言 2024-06-07 v3 人工智能

摘要

本文提出迄今最大的语言可接受性基准:多语言语言可接受性评估(Multilingual Evaluation of Linguistic Acceptability, MELA),包含46K样本,覆盖来自不同语系的10种语言。我们在该基准上建立了LLM基线,并利用XLM-R探究可接受性判断中的跨语言迁移。为追求多语言可解释性,我们使用微调后的XLM-R进行探测实验,探索句法能力习得过程。结果显示,GPT-4o展现出强大的多语言能力,优于微调的XLM-R,而开源多语言模型则明显落后。跨语言迁移实验表明可接受性判断中的迁移并非易事:500条冰岛语微调样本在完全无关的语言——中文上取得了23的MCC性能。探测实验结果表明,在MELA上训练提升了XLM-R在句法相关任务上的表现。我们的数据已发布于 https://github.com/sjtu-compling/MELA。

关键词

引用

@article{arxiv.2311.09033,
  title  = {MELA: Multilingual Evaluation of Linguistic Acceptability},
  author = {Ziyin Zhang and Yikang Liu and Weifang Huang and Junyu Mao and Rui Wang and Hai Hu},
  journal= {arXiv preprint arXiv:2311.09033},
  year   = {2024}
}

备注

ACL 2024 camera-ready