基于深度神经网络的短文本对话及评测指标分析
计算与语言
2019-07-09 v1
摘要
随着自然语言处理的发展,诸如Waston、Siri、Alexa等自动问答系统已成为最重要的NLP应用之一。如今,企业试图构建自动客服聊天机器人以节省人力资源并提供24小时客户服务。目前聊天机器人的评估极大依赖人工标注,耗时颇多。因此,引发了短文本对话的一个新子任务——对话质量(DQ)与要点检测(ND),旨在自动评估聊天机器人生成的对话。本文中,我们通过深度神经网络解决DQ与ND子任务。我们为DQ和ND子任务各提出了一个由层次结构构成的模型:嵌入层、话语层、上下文层和记忆层,以从词级、句级、上下文级到长距离上下文级层次化学习对话表示。此外,我们在话语层和上下文层应用门控与注意力机制以提升性能。我们也尝试用BERT替代嵌入层与话语层作为句子表示。结果表明,在DQ和ND子任务中BERT比多层堆叠CNN产生了更好的话语表示,并优于其他研究者提出的模型。评测指标由提出,即DQ的NMD、RSNOD与ND的JSD、RNSS,这些并非准确率、精确率、召回率和F1分数等传统评测指标。因此,我们使用传统评测指标进行了一系列实验并分析了性能与误差。
引用
@article{arxiv.1907.03070,
title = {Short Text Conversation Based on Deep Neural Network and Analysis on Evaluation Measures},
author = {Hsiang-En Cherng and Chia-Hui Chang},
journal= {arXiv preprint arXiv:1907.03070},
year = {2019}
}
备注
8 pages, 5 figures