中文

利用 NLP 对 Banglish 文本进行产品市场需求分析:结合情感分析与命名实体识别

计算与语言 2022-04-06 v1

摘要

产品市场需求分析因其对竞争商业领域的显著影响,在制定商业策略中发挥着重要作用。此外,约有 2.28 亿孟加拉语母语者,其中大多数在社交媒体上使用 Banglish 文本相互交流。随着社交媒体成为创业者的在线市场,消费者正使用 Banglish 文本在社交媒体上购买和评价商品。人们通过分享对首选智能手机品牌和型号的正面和负面体验,在社交媒体上寻找心仪产品。为此,我们的目标是通过情感分析和命名实体识别收集 Banglish 文本数据,以评估孟加拉国市场对智能手机的需求,从而按性别确定最受欢迎的智能手机。我们使用即时数据抓取器从社交媒体抓取产品相关数据,并用 Python 网络爬虫从维基百科及其他站点爬取产品信息。利用 Python 的 Pandas 和 Seaborn 库,通过 NLP 方法对原始数据进行过滤。为训练命名实体识别数据集,我们采用了 Spacey 的自定义 NER 模型和 Amazon Comprehend Custom NER。部署了带参数调整的 tensorflow 序列模型用于情感分析。同时,我们使用 Google Cloud Translation API 借助 BanglaLinga 库估算评论者性别。本文中,我们运用自然语言处理(NLP)方法和若干机器学习模型来识别孟加拉国市场中最需求的物品与服务。我们的模型在 Spacy 自定义命名实体识别中准确率为 87.99%,在 Amazon Comprehend Custom NER 中为 95.51%,在用于需求分析的序列模型中为 87.02%。经 Spacy 研究后,我们通过结合 Levenshtein 距离与比率算法,得以处理 80% 与拼写错误相关的错误。

关键词

引用

@article{arxiv.2204.01827,
  title  = {Product Market Demand Analysis Using NLP in Banglish Text with Sentiment Analysis and Named Entity Recognition},
  author = {Md Sabbir Hossain and Nishat Nayla and Annajiat Alim Rasel},
  journal= {arXiv preprint arXiv:2204.01827},
  year   = {2022}
}