中文

尼泊尔语孕期聊天机器人的检索与生成方法比较:基于词干化与非词干化数据

计算与语言 2023-11-14 v1 机器学习

摘要

自然语言处理领域涉及利用人工智能支撑人类语言,因其高质量特性而取得巨大发展。其应用如语言翻译、聊天机器人、虚拟助手、搜索自动补全与自动纠正在医疗、广告、客户服务与目标广告等多个领域被广泛使用。为提供孕期相关信息,已有健康领域聊天机器人被提出,本工作探索了两种基于 NLP 的不同方法来开发该聊天机器人。第一种方法为基于多类分类的检索方法,使用基于 BERT 的多语言 BERT 与多语言 DistilBERT;另一种方法采用基于 transformer 的生成式聊天机器人提供孕期相关信息。针对每种方法,分析了尼泊尔语中词干化与非词干化数据集的性能。实验结果表明,基于 BERT 的预训练模型在非词干化数据上表现良好,而从零训练的 transformer 模型在词干化数据上表现更优。在所测试模型中,DistilBERT 模型在基于检索的模型架构于非词干化数据集上的实现取得了最高训练与验证精度及 0.9165 的测试精度。类似地,在生成式方法架构以 transformer 实现中,分别取得了 0.3570 的 1 元 BLEU 与 0.1413 的 2 元 BLEU 分数。

关键词

引用

@article{arxiv.2311.06898,
  title  = {Retrieval and Generative Approaches for a Pregnancy Chatbot in Nepali with Stemmed and Non-Stemmed Data : A Comparative Study},
  author = {Sujan Poudel and Nabin Ghimire and Bipesh Subedi and Saugat Singh},
  journal= {arXiv preprint arXiv:2311.06898},
  year   = {2023}
}

备注

7 pages, 5 figures, 4 tables. In proceedings of the International Conference on Technologies for Computer, Electrical, Electronics & Communication (ICT-CEEL 2023), Bhaktapur, Nepal