中文

BanglaBait:基于半监督对抗方法的孟加拉语点击诱饵数据集点击诱饵检测

计算与语言 2023-11-13 v1 人工智能

摘要

通过利用读者好奇心故意引诱其点击特定内容可将标题定义为点击诱饵。尽管若干研究聚焦于检测英文文章中的点击诱饵标题,像孟加拉语这样的低资源语言尚未得到充分关注。为应对孟加拉语中的点击诱饵标题,我们构建了首个孟加拉语点击诱饵检测数据集,包含从点击诱饵密集新闻站点提取的15,056篇标注新闻文章与65,406篇未标注新闻文章。每篇文章由三位专家语言学家标注,并包含文章标题、正文及其他元数据。通过结合标注与未标注数据,我们以对抗方式使用半监督生成对抗网络(SS GANs)微调一个预训练的孟加拉语Transformer模型。所提模型作为该数据集的良好基线,优于传统神经网络模型(LSTM、GRU、CNN)及基于语言特征的模型。我们期望该数据集及对这些点击诱饵检测模型的详细分析与比较,将为未来孟加拉语文章点击诱饵标题检测研究提供基础。我们已发布相应代码与数据集。

关键词

引用

@article{arxiv.2311.06204,
  title  = {BanglaBait: Semi-Supervised Adversarial Approach for Clickbait Detection on Bangla Clickbait Dataset},
  author = {Md. Motahar Mahtab and Monirul Haque and Mehedi Hasan and Farig Sadeque},
  journal= {arXiv preprint arXiv:2311.06204},
  year   = {2023}
}

备注

8 pages, 3 figures, 5 tables, published in Recent Advances in Natural Language Processing 2023