中文

用于波斯语多领域情感分析的加权胶囊网络

计算与语言 2023-07-04 v2 人工智能

摘要

情感分类是自然语言处理中的一项基本任务,为自由文本分配正、负或中性三类之一。然而,情感分类模型高度依赖领域;由于词语的语义多义性导致精度下降,分类器可能在一个领域以合理精度分类而在另一领域表现不佳。本文提出一种基于累积加权胶囊网络方法的波斯语/阿拉伯语多领域情感分析新方法。加权胶囊集成包括为每个领域训练独立的胶囊网络,以及一种称为领域归属度(DBD)的加权度量。该准则由 TF 与 IDF 组成,分别计算每篇文档对各领域的依赖度;该值乘以每个胶囊产生的可能输出。最终,这些乘积之和作为最终输出的标题,并用于判定极性。且最依赖的领域被视为各领域的最终输出。所提方法使用 Digikala 数据集评估,相较现有方法取得了可接受精度:在领域归属检测上达到 0.89 准确率,在极性检测上达到 0.99 准确率。此外,针对不平衡类问题,采用了代价敏感函数,该函数在情感分类上实现了 0.0162 的精度提升。该方法在 Amazon Arabic 数据上于领域分类可取得 0.9695 的准确率。

关键词

引用

@article{arxiv.2306.17068,
  title  = {weighted CapsuleNet networks for Persian multi-domain sentiment analysis},
  author = {Mahboobeh Sadat Kobari and Nima Karimi and Benyamin Pourhosseini and Ramin Mousa},
  journal= {arXiv preprint arXiv:2306.17068},
  year   = {2023}
}