PETCI:中文成语的英译平行数据集
计算与语言
2022-02-22 v1 机器学习
摘要
成语是中文中重要的语言现象,但成语翻译向来困难。当前的机器翻译模型在成语翻译上表现不佳,且成语在许多翻译数据集中较为稀疏。我们提出 PETCI,一个中文成语的英译平行数据集,旨在改善人与机器的成语翻译。该数据集通过结合人工与机器的方式构建。基线生成模型在改进翻译方面能力不尽如人意,但结构感知的分类模型在区分优质翻译上表现良好。此外,PETCI 的规模可在无需专业知识的情况下轻松扩充。总体而言,PETCI 可有助于语言学习者和机器翻译系统。
引用
@article{arxiv.2202.09509,
title = {PETCI: A Parallel English Translation Dataset of Chinese Idioms},
author = {Kenan Tang},
journal= {arXiv preprint arXiv:2202.09509},
year = {2022}
}