基于通用知识数据集的 Transformer 孟加拉语聊天机器人
计算与语言
2021-11-10 v2 人工智能
摘要
AI 聊天机器人从训练数据集中学习后能提供令人印象深刻的回复。在本十年,多数研究结果表明深度神经模型优于任何其他模型。RNN 模型常用于确定如问题与答案之类的序列相关问题。这种方法以 seq2seq 学习之名而为众人所知。在 seq2seq 模型机制中,其包含编码器与解码器。编码器嵌入任意输入序列,解码器嵌入输出序列。为增强 seq2seq 模型性能,注意力机制被加入编码器与解码器。此后,Transformer 模型以其多重注意力机制的高性能姿态出现,用于解决序列相关难题。该模型相较于基于 RNN 的模型减少了训练时间,并在序列转导上取得了最先进(SOTA)性能。在本研究中,我们基于孟加拉语通用知识问答(QA)数据集,将 Transformer 模型应用于孟加拉语通用知识聊天机器人。其在所用 QA 数据上取得 85.0 BLEU 分数。为检验 Transformer 模型性能对比,我们在该数据集上训练了带注意力的 seq2seq 模型,其取得 23.5 BLEU。
引用
@article{arxiv.2111.03937,
title = {Transformer Based Bengali Chatbot Using General Knowledge Dataset},
author = {Abu Kaisar Mohammad Masum and Sheikh Abujar and Sharmin Akter and Nushrat Jahan Ria and Syed Akhter Hossain},
journal= {arXiv preprint arXiv:2111.03937},
year = {2021}
}
备注
4 pages, 3 figures, supplemental materials