面向多语言翻译体分类的特征工程与特征学习方法比较
计算与语言
2021-09-17 v1
摘要
传统的手工构建、语言信息驱动的特征常被用于区分翻译文本与原创非翻译文本。相比之下,迄今无手动特征工程的神经架构在该任务上探索较少。本工作中,我们(i)将传统的基于特征工程的方法与基于特征学习的方法进行比较,并(ii)分析神经架构以考察手工特征在多大程度上解释神经模型预测的方差。我们使用预训练神经词嵌入,以及若干端到端神经架构(在单语与多语设定下),并将其与基于特征工程的SVM分类器比较。我们表明:(i)神经架构以超过20个准确率点的优势优于其他方法,其中基于BERT的模型在单语与多语设定下均表现最佳;(ii)尽管许多单独的手工翻译体特征与神经模型预测相关,但特征重要性分析显示对神经与经典架构最重要的特征不同;(iii)我们的多语言实验为跨语言的翻译体普遍性提供了经验证据。
引用
@article{arxiv.2109.07604,
title = {Comparing Feature-Engineering and Feature-Learning Approaches for Multilingual Translationese Classification},
author = {Daria Pylypenko and Kwabena Amponsah-Kaakyire and Koel Dutta Chowdhury and Josef van Genabith and Cristina España-Bonet},
journal= {arXiv preprint arXiv:2109.07604},
year = {2021}
}
备注
9 pages, 5 pages appendix, 2 figures, 7 tables. The first 3 authors contributed equally. Accepted to EMNLP 2021, Main Conference