少样本与零样本设定下的委婉语检测探索
计算与语言
2022-10-25 v1
摘要
本研究基于 EMNLP 2022 FigLang Workshop 提出的委婉语检测共享任务,并将其扩展至少样本与零样本设定。我们利用该共享任务的数据集给出了少样本与零样本的形式化定义,并使用 RoBERTa 与 GPT-3 在这些设定下开展实验。结果表明,语言模型即便在训练时未见过的新词上也能相对较好地分类委婉术语,表明其能够捕捉与委婉语相关的高层概念。
引用
@article{arxiv.2210.12926,
title = {Exploring Euphemism Detection in Few-Shot and Zero-Shot Settings},
author = {Sedrick Scott Keh},
journal= {arXiv preprint arXiv:2210.12926},
year = {2022}
}
备注
Accepted to EMNLP 2022 Figurative Language Workshop (Euphemism Detection Shared Task). Official code at https://github.com/sedrickkeh/zero-shot-euphemism-detection