中文

基于人工智能的聊天机器人交互:利用 T5 与语言 Transformer 集成进行文本分类的人源数据增强

计算与语言 2020-10-23 v2 人工智能

摘要

在这项工作中,我们提出聊天机器人人工智能交互(CI-AI)框架,作为一种训练深度学习聊天机器人进行任务分类的方法。该智能系统通过人工改写进行数据增强,以生成大规模训练数据,用于后续基于经典、注意力和语言变换的自然语言处理方法。人类被要求对命令和问题进行改写以进行任务识别,从而供机器进一步执行。命令和问题被划分为训练集和验证集。共记录了 483 条响应。其次,训练集由 T5 模型进行改写以增强数据。七种最先进的基于 transformer 的文本分类算法(BERT、DistilBERT、RoBERTa、DistilRoBERTa、XLM、XLM-RoBERTa 和 XLNet)在训练数据上微调两个 epoch 后于两个集合上进行基准测试。我们发现,当训练数据由 T5 模型增强时,所有模型均有所提升,分类准确率平均提高 4.01%。最佳结果为在 T5 增强数据上训练的 RoBERTa 模型,其达到了 98.96% 的分类准确率。最后,我们发现通过逻辑回归对五个最佳性能 transformer 模型输出标签预测进行集成,在人类响应数据集上达到了 99.59% 的准确率。高性能模型使智能系统能够通过类聊天机器人界面(例如“机器人,我们可以聊聊天吗?”)在社会交互层面解读人类命令,并让非技术用户更好地接触 AI。

关键词

引用

@article{arxiv.2010.05990,
  title  = {Chatbot Interaction with Artificial Intelligence: Human Data Augmentation with T5 and Language Transformer Ensemble for Text Classification},
  author = {Jordan J. Bird and Anikó Ekárt and Diego R. Faria},
  journal= {arXiv preprint arXiv:2010.05990},
  year   = {2020}
}

备注

18 pages, 10 figures, 8 tables