中文

韩文公共AI Hub平行语料库的实证分析及基于LIWC的深入探究

计算与语言 2021-10-29 v1

摘要

机器翻译(MT)系统旨在将源语言翻译为目标语言。近期关于MT系统的研究主要聚焦于神经机器翻译(NMT)。显著影响NMT性能的一个因素在于高质量平行语料库的可用性。然而,与其他高资源语言(如德语或意大利语)相关的语料相比,涉及韩语的高质量平行语料相对匮乏。为解决此问题,AI Hub近期发布了七类韩语平行语料库。在本研究中,我们通过语言探询与词频统计(LIWC)及若干相关实验对所对应平行语料库的质量进行深度验证。LIWC是一款基于词典、能以多种方式分析语料并提取语言特征的词频统计软件。据我们所知,本研究是首个在NMT领域使用LIWC分析平行语料库的工作。我们的发现通过LIWC与NMT性能的相关性分析,指出了进一步提升平行语料库质量的研究方向。

关键词

引用

@article{arxiv.2110.15023,
  title  = {Empirical Analysis of Korean Public AI Hub Parallel Corpora and in-depth Analysis using LIWC},
  author = {Chanjun Park and Midan Shim and Sugyeong Eo and Seolhwa Lee and Jaehyung Seo and Hyeonseok Moon and Heuiseok Lim},
  journal= {arXiv preprint arXiv:2110.15023},
  year   = {2021}
}