面向对话智能体构建的自然语言理解服务基准评测
计算与语言
2019-03-27 v3 机器学习
摘要
我们近期观察到若干公开可用的自然语言理解(NLU)工具包涌现,它们将用户话语映射为结构化但更抽象的对话行为(DA)或意图(Intent)规范,同时使普通开发者也能使用该过程。本文首次对部分最流行的 NLU 服务进行了广泛覆盖的评测与比较,所用数据集为我们收集并标注了意图与实体类型规范、包含 25K 条用户话语的大型多领域(21 个领域)数据集,该数据集将作为本次提交的一部分发布。结果表明,在意图分类上 Watson 显著优于其他平台,即 Dialogflow、LUIS 和 Rasa;尽管后者表现也良好。有趣的是,在实体类型识别上,Watson 因其低精确率而表现显著更差。同样,Dialogflow、LUIS 和 Rasa 在此任务上表现良好。
引用
@article{arxiv.1903.05566,
title = {Benchmarking Natural Language Understanding Services for building Conversational Agents},
author = {Xingkun Liu and Arash Eshghi and Pawel Swietojanski and Verena Rieser},
journal= {arXiv preprint arXiv:1903.05566},
year = {2019}
}
备注
Accepted by IWSDS2019