中文

使用 ParsBERT 与不平衡数据处理方法的波斯语情感检测

计算与语言 2022-11-21 v2

摘要

情感识别是机器学习应用之一,可利用从社交媒体空间收集的文本、语音或图像数据完成。检测情感可在包括意见挖掘在内的不同领域帮助我们。随着社交媒体扩散,Twitter 等不同平台已成为数据源,且这些平台所用语言为非正式语言,使情感检测任务困难。EmoPars 与 ArmanEmo 是两个新的人标波斯语情感数据集。这些数据集(尤其是 EmoPars)存在两类间样本数量不均的问题。本文中我们评估 EmoPars 并与 ArmanEmo 比较。在此分析中,我们使用数据增强技术、数据重采样和类权重,结合基于 Transformer 的预训练语言模型(PLMs)来处理这些数据集的不平衡问题。此外,使用特征选择通过强调文本的特定特征来提升模型性能。另外,我们提供了一种从 EmoPars 选取数据的新策略,其选取高置信度样本;因此模型在训练时不会见到无特定情感的样本。我们的模型在 ArmanEmo 与 EmoPars 上分别达到 0.81 与 0.76 的宏平均 F1 分数,这些是这些基准上的新 SOTA 结果。

关键词

引用

@article{arxiv.2211.08029,
  title  = {Persian Emotion Detection using ParsBERT and Imbalanced Data Handling Approaches},
  author = {Amirhossein Abaskohi and Nazanin Sabri and Behnam Bahrak},
  journal= {arXiv preprint arXiv:2211.08029},
  year   = {2022}
}

备注

14 pages, 5 figures, 9 tables