面向自适应机器翻译的商业领域无监督聚类
计算与语言
2016-12-15 v1
摘要
在本文中,我们报告了自适应机器翻译架构范围内的领域聚类工作。我们使用五种不同的距离度量实例化了一个标准的自底向上层次聚类算法,并在一个基于 40 个商业领域构建的机器翻译基准上,从树状图、内部评估和外部评估方面对这些距离度量进行了比较。主要结果是,计算代价最高的距离也是唯一一种能够使机器翻译引擎即使在领域聚类数量少但高度密集的情况下也能保证良好性能的距离。
引用
@article{arxiv.1612.04683,
title = {Unsupervised Clustering of Commercial Domains for Adaptive Machine Translation},
author = {Mauro Cettolo and Mara Chinea Rios and Roldano Cattoni},
journal= {arXiv preprint arXiv:1612.04683},
year = {2016}
}
备注
9 pages report on Summer Internship at FBK