利用机器翻译在一天内本地化开放本体问答语义解析器
计算与语言
2020-10-13 v1 机器学习
摘要
我们提出语义解析器本地化工具(SPL),一个利用神经机器翻译(NMT)系统为语义解析器本地化至新语言的工具包。我们的方法是:(1)通过用从公共网站抓取的本地实体增强机器翻译数据集,自动生成目标语言训练数据;(2)加入少量人工翻译句子的少样本增强并训练一种新颖的XLMR-LSTM语义解析器;(3)使用人工翻译者整理的自然话语测试模型。我们将当前Schema2QA(一个面向开放网页英文问答(QA)的系统)的能力扩展至餐厅和酒店领域的10种新语言,以评估方法有效性。我们的模型在酒店领域总体测试准确率为61%至69%,餐厅领域为64%至78%,优于基于黄金英文数据和验证集少量样本训练的英文解析器的69%和80%。我们表明,对于所测语言子集,我们的方法以本地化本体在酒店领域超越先前最优方法30%以上、餐厅领域40%以上。我们的方法使任何软件开发者都能借助机器翻译在不到24小时内为新领域QA系统添加新语言能力。
引用
@article{arxiv.2010.05106,
title = {Localizing Open-Ontology QA Semantic Parsers in a Day Using Machine Translation},
author = {Mehrad Moradshahi and Giovanni Campagna and Sina J. Semnani and Silei Xu and Monica S. Lam},
journal= {arXiv preprint arXiv:2010.05106},
year = {2020}
}
备注
Published in EMNLP 2020