中文

一种用于点击欺骗检测与策略归因的可解释基准

计算与语言 2025-09-16 v1

摘要

点击欺骗标题的滋生对信息可信度和用户对数字媒体的信任构成严重挑战。虽然近期机器学习进步提高了对操纵内容的检测能力,但缺乏可解释性限制了其实际应用。本文提出了一种可解释的点击欺骗检测模型,不仅识别点击欺骗标题,还将其归因于特定的语言操纵策略。我们引入了一个通过系统性地使用预定义的点击欺骗策略扩展真实新闻标题而生成的合成数据集。该数据集 enables 受控实验和对模型行为的详细分析。我们提出了一个用于自动点击欺骗分析的两个阶段框架,包括检测和策略归因。在第一个阶段,我们比较了微调的 BERT 分类器与大型语言模型(LLM),具体包括 GPT-4.0 和 Gemini 2.4 Flash,在零样本提示和使用示例点击欺骗标题及其相关说服策略的 few-shot 提示下进行测试。在第二个阶段,一个专门的 BERT 基于分类器预测每个标题中存在的特定点击欺骗策略。本工作推动了开发透明且可信赖的人工智能系统,以应对操纵性媒体内容。我们在 https://github.com/LLM-HITCS25S/ClickbaitTacticsDetection 与研究社区共享了数据集。

关键词

引用

@article{arxiv.2509.10937,
  title  = {An Interpretable Benchmark for Clickbait Detection and Tactic Attribution},
  author = {Lihi Nofar and Tomer Portal and Aviv Elbaz and Alexander Apartsin and Yehudit Aperstein},
  journal= {arXiv preprint arXiv:2509.10937},
  year   = {2025}
}

备注

7 pages