中文

UTNLP 在 SemEval-2022 任务 6:基于生成式与基于变异的数据增强的讽刺检测对比分析

计算与语言 2022-10-21 v5

摘要

讽刺是指用言语嘲弄、激怒或逗乐他人的一种表达。它在社交媒体上常见。讽刺的隐喻性与创造性给基于情感计算的情感分析系统带来了显著困难。本文介绍了我们团队 UTNLP 在 SemEval-2022 共享任务 6(讽刺检测)中的方法与结果。我们对不同模型与数据增强方法进行了测试,并报告了效果最佳者。测试从传统机器学习模型开始,逐步推进到基于 transformer 与基于注意力的模型。我们采用了基于数据变异与数据生成的数据增强。在竞赛评估阶段,我们使用 RoBERTa 与基于变异的数据增强的最佳方法取得了 0.38 的 F1-sarcastic 分数。竞赛结束后,我们修正了模型的缺陷,取得了 0.414 的 F1-sarcastic 分数。

关键词

引用

@article{arxiv.2204.08198,
  title  = {UTNLP at SemEval-2022 Task 6: A Comparative Analysis of Sarcasm Detection Using Generative-based and Mutation-based Data Augmentation},
  author = {Amirhossein Abaskohi and Arash Rasouli and Tanin Zeraati and Behnam Bahrak},
  journal= {arXiv preprint arXiv:2204.08198},
  year   = {2022}
}

备注

6 pages, 2 figures, International Workshop on Semantic Evaluation co-located with NAACL