基于无监督域自适应的方言搜索查询翻译
计算与语言
2022-08-09 v1
摘要
随着电子商务平台的普及,日益多元化的用户群体选择在线购物。为提供舒适可靠的购物体验,让用户以其所选语言与平台交互十分重要。准确的查询翻译对于处理方言查询的跨语言信息检索(CLIR)至关重要。由于互联网规模级的运营,电子商务平台每天收到数百万条搜索查询。然而,创建并行训练集来训练领域内翻译模型十分繁琐。本文提出一种无监督域自适应方法,在不使用任何并行语料库的情况下翻译搜索查询。我们使用开放域翻译模型(在公开语料上训练),并仅利用两种语言的单语查询将其自适应到查询数据上。此外,使用小规模标注集进行微调可进一步提升结果。为作演示,我们展示了印地语到英语查询翻译的结果,并以 mBART-large-50 模型作为基线进行改进。实验结果表明,在不使用任何并行语料库的情况下,我们相较基线获得了超过 20 个 BLEU 点的提升,而使用 5 万条小规模标注集微调可相较基线获得超过 27 个 BLEU 点的提升。
引用
@article{arxiv.2208.03711,
title = {Vernacular Search Query Translation with Unsupervised Domain Adaptation},
author = {Mandar Kulkarni and Nikesh Garera},
journal= {arXiv preprint arXiv:2208.03711},
year = {2022}
}