基于分布的组合性评估用于评价机器翻译中的组合泛化
计算与语言
2023-11-15 v1
摘要
组合泛化(CG)在自然语言处理和更广义的机器学习中,大多使用人工数据集进行评估。开发基准以在真实世界自然语言任务中评估 CG 十分重要,从而理解实际部署系统的能力与局限。为此,我们的 GenBench 协作基准测试任务提交利用基于分布的组合性评估(DBCA)框架将 Europarl 翻译语料库划分为训练集和测试集,使得测试集需要组合泛化能力。具体而言,训练集与测试集具有分歧的依存关系分布,测试神经机器翻译(NMT)系统翻译其未训练过依存关系的能力。这是一种全自动创建自然语言组合性基准的流程,使其可简单且低成本地进一步应用于其他数据集与语言。实验的代码与数据可在 https://github.com/aalto-speech/dbca 获取。
引用
@article{arxiv.2311.08249,
title = {On Using Distribution-Based Compositionality Assessment to Evaluate Compositional Generalisation in Machine Translation},
author = {Anssi Moisio and Mathias Creutz and Mikko Kurimo},
journal= {arXiv preprint arXiv:2311.08249},
year = {2023}
}
备注
To appear at the GenBench Workshop at EMNLP 2023