中文

面向 Bangla 对话代理的端到端自然语言理解流水线

计算与语言 2021-10-14 v6 人工智能 机器学习

摘要

聊天机器人是一种智能软件,被构建用以替代人类交互。现有研究通常对 Bangla 等低资源语言支持不足。随着社交媒体的日益普及,我们也看到母语为 Bangla 的使用者之间以 Bangla 音译(多为英文)形式的交互在增多。本文提出一种构建 Bangla 聊天机器人的新方法,旨在用作商业助手,能够以高且稳定的置信度使用 Bangla 及英文 Bangla 音译等低资源语言进行通信。由于此前无标注数据可用,我们不得不使用 Rasa 开源框架、fastText 嵌入、Polyglot 嵌入、Flask 及其他系统作为构建模块,处理完整的机器学习生命周期(数据准备、机器学习建模与模型部署)。在处理偏斜标注数据集时,我们尝试不同组件与流水线以评估何种效果最佳,并对观测结果背后的可能原因提供解释。最后,我们给出一种意图分类与实体抽取的流水线,其取得了合理的性能(准确率:83.02%,精确率:80.82%,召回率:83.02%,F1 分数:80%)。

关键词

引用

@article{arxiv.2107.05541,
  title  = {End-to-End Natural Language Understanding Pipeline for Bangla Conversational Agents},
  author = {Fahim Shahriar Khan and Mueeze Al Mushabbir and Mohammad Sabik Irbaz and MD Abdullah Al Nasim},
  journal= {arXiv preprint arXiv:2107.05541},
  year   = {2021}
}

备注

Accepted in IEEE International Conference on Machine Learning and Applications 2021 (IEEE ICMLA 2021)