点击或离开:基于信息性措施和大型语言模型的点击诱导内容检测与贬抑
计算与语言
2026-02-23 v1 人工智能
摘要
点击诱导内容标题会降低在线信息质量,并削弱用户信任。我们提出了一种混合方法,用于点击诱导内容检测,将基于转换器的文本嵌入与以语言学方式表达的信息性特征相结合。使用自然语言处理技术,我们评估了经典向量化器、词嵌入基线以及大型语言模型嵌入搭配基于树的分类器。我们最佳的模型是使用 XGBoost 对嵌入增强的 15 个显式特征,实现 F1 分数达到 91%,超越 TF-IDF、Word2Vec、GloVe、LLM 提示基于分类以及仅基于特征的基线。该提议的特征集通过突出显示第二人称代词、绝对词、数值以及面向注意力的标点等显著语言线索,增强了可解释性,实现透明且校准良好的点击诱导内容预测。我们发布代码和训练好的模型,以支持可重复的研究。
引用
@article{arxiv.2602.18171,
title = {Click it or Leave it: Detecting and Spoiling Clickbait with Informativeness Measures and Large Language Models},
author = {Wojciech Michaluk and Tymoteusz Urban and Mateusz Kubita and Soveatin Kuntur and Anna Wroblewska},
journal= {arXiv preprint arXiv:2602.18171},
year = {2026}
}