中文

Plumeria 在 SemEval-2022 任务6:基于 Transformers 与数据增强的英语和阿拉伯语讽刺检测鲁棒方法

计算与语言 2022-03-09 v1 人工智能 机器学习

摘要

本文描述了我们向 SemEval-2022 任务6(英语与阿拉伯语讽刺检测及其五个子任务)的提交。讽刺传达与字面意义相反的含义,主要出现于社交网络,对理解用户意图具有重要作用。为检测讽刺,我们使用了基于 transformers 的深度学习技术,因其在自然语言处理(NLP)领域的成功而无需特征工程。数据集取自推文。我们通过外部数据增强或使用词嵌入与实例重复创建了新数据集。由于预处理在此任务中至关重要,我们在不同预处理类型的数据集上进行了实验。我们团队的排名在四个子任务中保持一致(三个子任务第四名,一个子任务第六名);而其他团队可能在某些子任务中名列前茅,却在另一些子任务中排名大幅下降。这意味着我们所用的模型与技术具有鲁棒性与稳定性。

关键词

引用

@article{arxiv.2203.04111,
  title  = {Plumeria at SemEval-2022 Task 6: Robust Approaches for Sarcasm Detection for English and Arabic Using Transformers and Data Augmentation},
  author = {Shubham Kumar Nigam and Mosab Shaheen},
  journal= {arXiv preprint arXiv:2203.04111},
  year   = {2022}
}

备注

SemEval-2022 workshop paper, submitted in NAACL-2022 conference. 8 figures and 29 tables. 8 main pages, 4 appendix pages