中文

阿拉伯语推文中的讽刺检测与量化

计算与语言 2021-08-04 v1 人工智能

摘要

预测文本中讽刺的作用被称为自动讽刺检测。鉴于讽刺在带有情感的文本中的普遍性和挑战性,这是大多数情感分析任务中的关键阶段。随着全球用户对各类社交媒体平台的使用和普及度日益增加,人们在日常对话、社交媒体帖子和推文中越来越多地使用讽刺,这被认为是人们表达对某些特定话题或问题情感的一种方式。由于这种日益增长的普及性,研究人员开始将研究重点放在从不同语言(尤其是英语)的文本中检测讽刺上。然而,讽刺检测任务因其文本性质而具有挑战性;讽刺文本可能是相对的,并且根据话题、地区、用户心态及其他因素,在不同个体之间存在显著差异。除了这些挑战之外,由于阿拉伯语的复杂性,例如其形态丰富、方言众多且差异显著,同时资源匮乏,阿拉伯语的讽刺检测有其自身的挑战。近年来,仅有少数研究尝试开始处理阿拉伯语讽刺检测任务,包括创建和收集语料库、组织研讨会和建立基线模型。本文旨在创建一个新的、从推文中收集的人工标注阿拉伯语讽刺检测语料库,并实现一种用于阿拉伯语推文讽刺检测与量化的新方法。本文所遵循的标注技术在讽刺检测中是独特的,并且所提出的方法将该问题作为回归问题而非分类问题来处理;即模型试图预测讽刺的程度,而不是进行二分类。

关键词

引用

@article{arxiv.2108.01425,
  title  = {sarcasm detection and quantification in arabic tweets},
  author = {Bashar Talafha and Muhy Eddin Za'ter and Samer Suleiman and Mahmoud Al-Ayyoub and Mohammed N. Al-Kabi},
  journal= {arXiv preprint arXiv:2108.01425},
  year   = {2021}
}