中文

借助生成式LLM降低讽刺语料风格偏置

计算与语言 2024-12-13 v1

摘要

讽刺检测对于准确提取文本数据中的意见并遏制线上虚假信息至关重要。然而,缺乏多样化语料导致风格偏置问题,影响模型的检测性能。本研究提出一种针对讽刺检测的去偏方法,关注通过利用生成式大型语言模型减少训练数据中的偏置。该方法在跨域(讽刺语检测)和跨语言(英语)两个场景中进行评估。结果表明,去偏方法在土耳其语和英语的讽刺与讽刺检测任务中提升了模型的鲁棒性和可泛化性。然而,对因果语言模型(如Llama-3.1)的影响有限。此外,本工作整理并提供了带有详细人工标注的土耳其讽刺新闻数据集,并就分类、去偏和可解释性进行了案例研究。

关键词

引用

@article{arxiv.2412.09247,
  title  = {Make Satire Boring Again: Reducing Stylistic Bias of Satirical Corpus by Utilizing Generative LLMs},
  author = {Asli Umay Ozturk and Recep Firat Cekinel and Pinar Karagoz},
  journal= {arXiv preprint arXiv:2412.09247},
  year   = {2024}
}

备注

Accepted to BUCC2025 Workshop @COLING2025