针对多种韩文 NLP 任务的分词策略实证研究
计算与语言
2020-10-07 v1
摘要
通常,分词是大多数文本处理工作的第一步。由于词元作为嵌入文本上下文信息的原子单位,如何定义词元对模型性能起着决定性作用。尽管字节对编码(BPE)因其简单性和通用性被视为事实上的标准分词方法,但 BPE 是否在所有语言和任务中都是最优的仍不清楚。在本文中,我们测试了若干分词策略,以回答我们的核心研究问题,即“韩文 NLP 任务的最佳分词策略是什么?”实验结果表明,形态切分后接 BPE 的混合方法在韩英双向机器翻译以及 KorNLI、KorSTS、NSMC 和 PAWS-X 等自然语言理解任务中效果最佳。作为例外,对于 SQuAD 的韩文扩展版 KorQuAD,BPE 切分被证明是最有效的。
引用
@article{arxiv.2010.02534,
title = {An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks},
author = {Kyubyong Park and Joohong Lee and Seongbo Jang and Dawoon Jung},
journal= {arXiv preprint arXiv:2010.02534},
year = {2020}
}
备注
Accepted to AACL-IJCNLP 2020