PAWS-X:用于释义识别的跨语言对抗数据集
计算与语言
2019-09-02 v1
摘要
大多数现有的对抗数据生成工作聚焦于英语。例如,PAWS(Paraphrase Adversaries from Word Scrambling)由来自 Wikipedia 和 Quora 的具有挑战性的英语释义识别对组成。我们通过 PAWS-X 弥补这一缺口,这是一个包含 23,659 个人工翻译的 PAWS 评测对的新数据集,涵盖六种类型学上不同的语言:法语、西班牙语、德语、中文、日语和韩语。我们为三种具有不同捕捉非局部上下文和句子结构能力的模型提供了基线数值,并使用了不同的多语言训练和评测机制。在多语言 BERT 上以 PAWS 英语加机器翻译数据微调的表现最佳,在非英语语言上准确率为 83.1-90.8,且平均准确率比次优模型高出 23%。PAWS-X 展示了深度多语言预训练的有效性,同时也留下了相当大的提升空间,作为一个新挑战以推动能更好捕捉结构和上下文信息的多语言研究。
引用
@article{arxiv.1908.11828,
title = {PAWS-X: A Cross-lingual Adversarial Dataset for Paraphrase Identification},
author = {Yinfei Yang and Yuan Zhang and Chris Tar and Jason Baldridge},
journal= {arXiv preprint arXiv:1908.11828},
year = {2019}
}
备注
Accepted by EMNLP2019