中文

EUREKA:基于 kNN 方法与数据增强的委婉语识别增强框架

计算与语言 2022-10-25 v1

摘要

我们介绍 EUREKA,一种基于集成方法的自动委婉语检测方案。我们 (1) 识别并修正数据集中潜在错误标注的样本,(2) 整理了一个称为 EuphAug 的扩展语料库,(3) 利用潜在委婉术语 (PETs) 的模型表示,以及 (4) 探索使用语义相近句子的表示来辅助分类。利用我们的增强数据集与基于 kNN 的方法,EUREKA 在委婉语检测共享任务的公开排行榜上取得了最先进的结果,以 0.881 的宏 F1 分数位居第一。我们的代码可在 https://github.com/sedrickkeh/EUREKA 获取。

关键词

引用

@article{arxiv.2210.12846,
  title  = {EUREKA: EUphemism Recognition Enhanced through Knn-based methods and Augmentation},
  author = {Sedrick Scott Keh and Rohit K. Bharadwaj and Emmy Liu and Simone Tedeschi and Varun Gangal and Roberto Navigli},
  journal= {arXiv preprint arXiv:2210.12846},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 Figurative Language Workshop; first place for Euphemism Detection Shared Task. Code at https://github.com/sedrickkeh/EUREKA