中文

HeBERT 与 HebEMO:一个希伯来语 BERT 模型及极性分析与情绪识别工具

计算与语言 2022-06-28 v3

摘要

本文介绍 HeBERT 与 HebEMO。HeBERT 是一个基于 Transformer 的现代希伯来语文本模型,依赖于 BERT(Bidirectional Encoder Representations for Transformers,Transformer 双向编码器表示)架构。BERT 已被证明在情感分析中优于其他架构,并被认为特别适用于形态丰富语言(MRLs)。通过分析多种 BERT 配置,我们发现,虽然模型复杂度与旨在理解句中词语的语言任务上的高性能相关,但更简洁的模型能更好地捕捉整句的情感。无论如何,我们基于 BERT 的语言模型在所有常见语言任务上均优于现有的所有希伯来语替代模型。HebEMO 是一个利用 HeBERT 从希伯来语用户生成内容(UGC)中检测极性和提取情绪的工具。HebEMO 在我们为本研究收集并标注的一个独特的 Covid-19 相关 UGC 数据集上训练。数据收集与标注遵循旨在最大化可预测性的主动学习流程。我们展示 HebEMO 在极性分类上取得了 0.96 的高 F1 值。除惊讶外(该模型未能捕捉,F1 = 0.41),情绪检测对各目标情绪达到了 0.78–0.97 的 F1 值。这些结果优于已报道的最佳性能,即便在英文情绪检测模型中也是如此。

关键词

引用

@article{arxiv.2102.01909,
  title  = {HeBERT & HebEMO: a Hebrew BERT Model and a Tool for Polarity Analysis and Emotion Recognition},
  author = {Avihay Chriqui and Inbal Yahav},
  journal= {arXiv preprint arXiv:2102.01909},
  year   = {2022}
}