KorNLI 与 KorSTS:面向韩语自然语言理解的新基准数据集
计算与语言
2020-10-06 v3
摘要
自然语言推理(NLI)与语义文本相似度(STS)是自然语言理解(NLU)中的关键任务。尽管已有若干面向英语及少数其他语言的此类任务基准数据集发布,但目前尚无公开可用的韩语 NLI 或 STS 数据集。受此驱动,我们构建并发布了韩语 NLI 与 STS 的新数据集,分别命名为 KorNLI 与 KorSTS。沿用已有方法,我们对现有英文训练集进行机器翻译,并人工将开发集与测试集翻译为韩语。为加速韩语 NLU 研究,我们还在 KorNLI 与 KorSTS 上建立了基线。我们的数据集公开于 https://github.com/kakaobrain/KorNLUDatasets。
引用
@article{arxiv.2004.03289,
title = {KorNLI and KorSTS: New Benchmark Datasets for Korean Natural Language Understanding},
author = {Jiyeon Ham and Yo Joong Choe and Kyubyong Park and Ilji Choi and Hyungjoon Soh},
journal= {arXiv preprint arXiv:2004.03289},
year = {2020}
}
备注
Findings of EMNLP 2020. Datasets available at https://github.com/kakaobrain/KorNLUDatasets