中文

解释翻译体:神经分类器为何更优及其学到了什么

计算与语言 2022-10-25 v1

摘要

近期研究表明,神经特征与表示学习(如 BERT)在翻译体分类任务中优于传统的基于人工特征工程的方法(如 SVM)。先前的研究未表明 (i)(i) 性能差异是源于特征、分类器还是两者兼有,以及 (ii)(ii) 神经分类器实际学到了什么。针对 (i)(i),我们精心设计与 BERT 及基于 SVM 的分类器之间互换特征的实验。我们展示,使用 BERT 表示输入的 SVM 可达到最佳 BERT 分类器的水平,而 BERT 学习并使用手工特征时的表现与使用该手工特征的 SVM 相当。这表明性能差异源于特征。针对 (ii)(ii),我们使用积分梯度(integrated gradients)发现:(a)(a) 有迹象表明手工特征所捕获的信息仅是 BERT 所学内容的子集,且 (b)(b) BERT 顶尖性能部分源于其学习了主题差异以及与翻译体的虚假相关性。

关键词

引用

@article{arxiv.2210.13391,
  title  = {Explaining Translationese: why are Neural Classifiers Better and what do they Learn?},
  author = {Kwabena Amponsah-Kaakyire and Daria Pylypenko and Josef van Genabith and Cristina España-Bonet},
  journal= {arXiv preprint arXiv:2210.13391},
  year   = {2022}
}

备注

16 pages, 7 figures, 4 tables. The first 2 authors contributed equally. Accepted to BlackboxNLP 2022 (at EMNLP 2022)