面向低资源语族的双语词典归纳的广义约束方法
计算与语言
2020-10-07 v1 人工智能
摘要
平行语料与可比语料的缺乏或缺失使得低资源语言的双语词典抽取成为困难任务。枢纽语言与同源词识别方法已被证明对此类语言的双语词典归纳有用。我们通过扩展近期基于枢纽的归纳技术中的约束,并进一步启用多重对称假设循环以在转换图中抵达更多同源词,提出了针对密切相近语言的基于约束的双语词典归纳。我们进一步识别同源词同义词以获得多对多翻译对。本文使用了四个数据集:一个南岛语系低资源语言与三个印欧语系高资源语言。我们使用先前工作中的三种基于约束的方法、Inverse Consultation方法以及由输入词典的笛卡尔积生成的翻译对作为基线。我们使用精确率、召回率与F值度量评估我们的结果。我们的可定制方法允许用户进行交叉验证,以预测最优超参数(同源词阈值与同源词同义词阈值),结合多种启发式策略与对称假设循环次数组合,从而获得最高F值。相较于我们先前的基于约束的方法,所提方法在精确率与F值上有统计显著改进。结果表明,我们的方法展现出补充其他双语词典创建方法(如高资源语言使用平行语料的词对齐模型)的潜力,同时能很好处理低资源语言。
引用
@article{arxiv.2010.02395,
title = {A Generalized Constraint Approach to Bilingual Dictionary Induction for Low-Resource Language Families},
author = {Arbi Haza Nasution and Yohei Murakami and Toru Ishida},
journal= {arXiv preprint arXiv:2010.02395},
year = {2020}
}
备注
30 pages, 13 figures, 14 tables, published in ACM TALLIP