使用自然语言处理的点击诱饵分类与剧透
计算与语言
2023-06-28 v1
摘要
点击诱饵是通过设计标题以激励读者点击进入文章的做法。此类带煽动性语言的标题尽可能少地透露信息。偶尔,点击诱饵会故意误导,因此自然语言处理(NLP)可扫描文章并回答点击诱饵标题所提问题,或对其剧透。我们处理两项任务:将点击诱饵分类为 3 类之一(任务 1),以及剧透点击诱饵(任务 2)。对于任务 1,我们提出两个二分类器以确定最终剧透类型。对于任务 2,我们尝试两种方法:使用问答模型识别剧透文本跨度,以及使用大语言模型(LLM)生成剧透。由于剧透包含于文章中,我们将第二项任务构建为识别剧透起止位置的问答方法。我们为任务 1 创建的模型优于数据集作者提出的基线,并为任务 2 设计了提示词,其表现不如数据集作者提出的基线,原因在于当输出文本来自生成模型而非抽取模型时评估指标表现更差。
引用
@article{arxiv.2306.14907,
title = {Clickbait Classification and Spoiling Using Natural Language Processing},
author = {Adhitya Thirumala and Elisa Ferracane},
journal= {arXiv preprint arXiv:2306.14907},
year = {2023}
}
备注
7 pages, 2 figures, 3 tables, 1 Appendix (3 Sections)