标签即信号:Telegram消息的URL无关可信度评分
社会与信息网络
2026-01-21 v1 计算机与社会
机器学习
摘要
Telegram已成为传播错误信息的主要平台之一。然而,许多现有管线仍根据关联域名声誉或词汇特征对每条消息的可信度进行分类。这些方法在知名来源发布的传统长篇新闻文章上表现良好,但Telegram上的高风险帖子简短且URL稀疏,导致基于链接的模型和标准TF-IDF模型失效。为此,我们提出了TAG2CRED管线,这是一种专为此类简短、复杂消息设计的方法。我们的模型将直接根据分配给文本的标签对每条帖子进行评分。我们设计了一个简洁的标签系统,涵盖主题、声明类型、行动号召和证据等维度。微调后的大语言模型(LLM)为消息分配标签,然后通过L2正则化逻辑回归将这些标签映射为[0,1]区间内的校准风险评分。我们使用URL掩码和域不交分割,对与Media Bias/Fact Check (MBFC)相关的87,936条Telegram消息进行了评估。结果显示,TAG2CRED模型的ROC-AUC达到0.871,macro-F1值为0.787,Brier分数为0.167,优于基线TF-IDF(macro-F1值0.737,Brier分数0.248);同时,该模型使用的特征数量少得多,在不常见域上的泛化能力更强。堆叠集成模型(TF-IDF + TAG2CRED + SBERT)的性能进一步优于基线SBERT。ROC-AUC达到0.901,macro-F1值为0.813(Brier分数0.114)。这表明风格标签和词汇特征可能捕获了信息风险中不同但互补的维度。
引用
@article{arxiv.2601.13294,
title = {The Tag is the Signal: URL-Agnostic Credibility Scoring for Messages on Telegram},
author = {Yipeng Wang and Huy Gia Han Vu and Mohit Singhal},
journal= {arXiv preprint arXiv:2601.13294},
year = {2026}
}