KoCoSa:韩语上下文感知讽刺检测数据集
计算与语言
2024-03-25 v2 人工智能
摘要
讽刺是一种言语反讽,说话者说出与本意相反的话,通常是为了嘲笑某个人、情况或观点。由于检测讽刺需要反映上下文(即对话历史),在对话中检测讽刺通常很困难。本文介绍了一个用于韩语对话讽刺检测任务的新数据集 KoCoSa(Korean Context-aware Sarcasm Detection Dataset,韩语上下文感知讽刺检测数据集),包含 12.8K 条日常韩语对话以及针对最后一条回复的该任务标签。为了构建该数据集,我们提出了一种高效的讽刺检测数据集生成流程:1)使用大语言模型从源对话生成新的讽刺对话;2)对异常和有毒对话进行自动和人工过滤;3)针对讽刺检测任务进行人工标注。我们还提供了一个在该数据集上训练的、简单但有效的韩语讽刺检测任务基线。在该数据集上的实验结果表明,我们的基线系统在韩语讽刺检测任务中优于 GPT-3.5 等大语言模型等强基线。我们表明,讽刺检测任务严重依赖于充足上下文的存在。我们将在 https://github.com/Yu-billie/KoCoSa_sarcasm_detection 发布该数据集。
引用
@article{arxiv.2402.14428,
title = {KoCoSa: Korean Context-aware Sarcasm Detection Dataset},
author = {Yumin Kim and Heejae Suh and Mingi Kim and Dongyeon Won and Hwanhee Lee},
journal= {arXiv preprint arXiv:2402.14428},
year = {2024}
}