基于剪枝数据集的讽刺检测微调
计算与语言
2022-12-26 v1 人工智能
摘要
讽刺是一种反语形式,涉及说出或写出与真实意图相反或相对的内容,常以幽默或嘲弄的方式。它常用来嘲弄某人或某物,或为了幽默逗趣。讽刺通常通过语调、面部表情或其他非语言交际形式传达,但也可由某些通常与反语或幽默相关的词语或短语指示。讽刺检测困难,因其依赖语境与非语言线索,也可能具有文化特定性、主观性与模糊性。本工作中,我们微调Abaskohi等人[2022]提出的基于RoBERTa的讽刺检测模型,在iSarcasm数据集(Oprea和Magdy[2019])上达到与最先进模型(Hercog等人[2022])相差0.02 F1的性能。该性能通过将iSarcasm与Self Annotated Reddit Corpus(SARC)(Khodak等人[2017])的剪枝版本增强而实现。我们的剪枝版本比用于训练最先进模型的SARC子集小100倍。
引用
@article{arxiv.2212.12213,
title = {Finetuning for Sarcasm Detection with a Pruned Dataset},
author = {Ishita Goyal and Priyank Bhandia and Sanjana Dulam},
journal= {arXiv preprint arXiv:2212.12213},
year = {2022}
}
备注
5 pages, 3 tables