基于机器翻译与跨语言迁移的捷克语阅读理解
计算与语言
2020-07-06 v1
摘要
阅读理解是一项被充分研究的任务,在英语中拥有庞大的训练数据集。本工作致力于构建捷克语的阅读理解系统,且无需任何人工标注的捷克语训练数据。首先,我们自动将 SQuAD 1.1 和 SQuAD 2.0 数据集翻译为捷克语,以创建训练和开发数据,并在 http://hdl.handle.net/11234/1-3249 发布。随后,我们训练并评估了多个 BERT 和 XLM-RoBERTa 基线模型。然而,我们的主要重点在于跨语言迁移模型。我们报告称,一个在英语数据上训练并在捷克语上评估的 XLM-RoBERTa 模型取得了极具竞争力的性能,仅比在翻译的捷克语数据上训练的模型差约 2 个百分点。考虑到该模型在训练期间未见过任何捷克语数据,这一结果极为出色。跨语言迁移方法非常灵活,并为任何拥有足够单语原始文本的语言提供阅读理解能力。
引用
@article{arxiv.2007.01667,
title = {Reading Comprehension in Czech via Machine Translation and Cross-lingual Transfer},
author = {Kateřina Macková and Milan Straka},
journal= {arXiv preprint arXiv:2007.01667},
year = {2020}
}
备注
Accepted at TSD 2020, 23rd International Conference on Text, Speech and Dialogue