应用于对话智能体的格式化文本多语言问答
计算与语言
2021-02-02 v2
摘要
语言模型(如 BERT、XLNet 等)的最新进展使得在阅读理解等复杂 NLP 任务上超越了人类表现。然而,用于训练的标注数据集大多为英文,这使得难以确认其他语言的进展。幸运的是,模型现在已在数百种语言的未标注数据上进行了预训练,并展现出有趣的跨语言迁移能力。在本文中,我们展示了多语言 BERT 天然具备从英文到其他语言的抽取式问答(eQA)任务的零样本迁移能力。具体而言,它超越了此前已知的迁移到日文和法文的最佳基线。此外,利用最近发布的大型 eQA 法文数据集,我们能够进一步表明:(1)零样本迁移给出的结果非常接近在目标语言上的直接训练;(2)迁移与目标语言训练相结合是总体最佳选择。我们最后展示了一个实际应用:一个名为 Kate 的多语言对话智能体,它直接从内联网页面内容中用多种语言回答与人力资源相关的问题。
引用
@article{arxiv.1910.04659,
title = {Multilingual Question Answering from Formatted Text applied to Conversational Agents},
author = {Wissam Siblini and Charlotte Pasqual and Axel Lavielle and Mohamed Challal and Cyril Cauchois},
journal= {arXiv preprint arXiv:1910.04659},
year = {2021}
}