中文

CoCoLoFa:由LLM辅助人群撰写的新闻评论逻辑谬误数据集

计算与语言 2024-10-07 v1

摘要

检测文本中的逻辑谬误有助于用户识别论点缺陷,但自动化检测困难重重。大规模、真实场景文本数据的谬误标注成本高昂。本文介绍CoCoLoFa,目前已知规模最大的逻辑谬误数据集,包含7,706条针对648篇新闻文章的评论,每条评论均标注了谬误的存在与类型。我们招募了143名众包工作者撰写特定谬误类型(如滑坡谬误)的评论以回应新闻文章。鉴于撰写任务的复杂性,我们在工作者界面中内置了LLM辅助工具,以协助其起草和润色评论。专家评估CoCoLoFa的写作质量和标注有效性表明,其高可靠性。使用CoCoLoFa微调的BERT模型在测试集上实现了最高的谬误检测(F1=0.86)和分类(F1=0.87)性能,优于最新的大语言模型。我们的工作表明,结合众包与大语言模型可更有效地构建此类复杂语言现象的数据集。

关键词

引用

@article{arxiv.2410.03457,
  title  = {CoCoLoFa: A Dataset of News Comments with Common Logical Fallacies Written by LLM-Assisted Crowds},
  author = {Min-Hsuan Yeh and Ruyuan Wan and Ting-Hao 'Kenneth' Huang},
  journal= {arXiv preprint arXiv:2410.03457},
  year   = {2024}
}

备注

In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024)