中文

基于剪枝数据集的讽刺检测微调

计算与语言 2022-12-26 v1 人工智能

摘要

讽刺是一种反语形式,涉及说出或写出与真实意图相反或相对的内容,常以幽默或嘲弄的方式。它常用来嘲弄某人或某物,或为了幽默逗趣。讽刺通常通过语调、面部表情或其他非语言交际形式传达,但也可由某些通常与反语或幽默相关的词语或短语指示。讽刺检测困难,因其依赖语境与非语言线索,也可能具有文化特定性、主观性与模糊性。本工作中,我们微调Abaskohi等人[2022]提出的基于RoBERTa的讽刺检测模型,在iSarcasm数据集(Oprea和Magdy[2019])上达到与最先进模型(Hercog等人[2022])相差0.02 F1的性能。该性能通过将iSarcasm与Self Annotated Reddit Corpus(SARC)(Khodak等人[2017])的剪枝版本增强而实现。我们的剪枝版本比用于训练最先进模型的SARC子集小100倍。

关键词

引用

@article{arxiv.2212.12213,
  title  = {Finetuning for Sarcasm Detection with a Pruned Dataset},
  author = {Ishita Goyal and Priyank Bhandia and Sanjana Dulam},
  journal= {arXiv preprint arXiv:2212.12213},
  year   = {2022}
}

备注

5 pages, 3 tables