结合上下文无关与上下文相关表示用于阿拉伯语讽刺检测与情感识别
计算与语言
2021-03-11 v1 机器学习
神经与进化计算
摘要
自诞生以来,基于Transformer的语言模型在多项自然语言处理任务中带来了令人瞩目的性能提升。对于阿拉伯语,当前大多数数据集上的最优结果由AraBERT语言模型取得。尽管有这些近期进展,鉴于阿拉伯语丰富的形态、语言差异和方言变体,讽刺与情感检测仍是具有挑战性的任务。本文提出SPPU-AASM团队为WANLP ArSarcasm共享任务2021提交的方案,该任务聚焦于阿拉伯语推文的讽刺与情感极性检测。研究提出一种混合模型,将AraBERT的句子表示与在阿拉伯语社交媒体语料上训练的静态词向量相结合。所提出的系统在讽刺和情感检测任务上分别取得了0.62的F1-sarcastic分数和0.715的F-PN分数。仿真结果表明,所提系统在两项任务上均优于多种现有方法,表明上下文无关与上下文相关文本表示的融合有助于捕捉阿拉伯语词意的互补层面。该系统在讽刺检测和情感识别两个子任务中分别排名第二和第十。
引用
@article{arxiv.2103.05683,
title = {Combining Context-Free and Contextualized Representations for Arabic Sarcasm Detection and Sentiment Identification},
author = {Amey Hengle and Atharva Kshirsagar and Shaily Desai and Manisha Marathe},
journal= {arXiv preprint arXiv:2103.05683},
year = {2021}
}
备注
7 pages, 1 figure, The Sixth Arabic Natural Language Processing Workshop. (WANLP 2021), held in conjunction with EACL 2021