开放权重 LLM 在社交媒体审核中的就绪性:来自 Bluesky 的比较研究
机器学习
2026-02-06 v1 数值分析
数值分析
摘要
随着互联网接入的扩大,人们暴露于有害内容的风险也随之增加,这加剧了有效审核的需求。研究表明,大型语言模型 (LLM) 可有效用于社交媒体审核任务,包括有害内容检测。虽然专有 LLM 已被证明在零样本情况下超过传统机器学习模型,但面向开放权重 LLM 的即插即用能力仍是一个未解决的问题。受推理 LLM 最近发展的启发,我们评估了七个最先进的模型:其中四个是专有模型,三个是开放权重模型。使用来自 Bluesky 的真实世界帖子、Bluesky 审核服务的审核决策,以及两位作者的注释,我们发现开放权重 LLM 的灵敏度 (81%--97%) 和特异度 (91%--100%) 与专有模型 (72%--98% 和 93%--99%) 之间存在相当程度的重合。此外,我们的分析显示,在謊言检测中,特异度超过灵敏度,但在不敬命和威胁检测中,情况则相反。最后,我们确定了人类审核员和 LLM 之间的评估者间的一致性,突显了在面向平台规模和个性化审核情境中部署 LLM 的考量因素。这些发现表明,开放权重 LLM 可在消费级硬件上支持隐私保护的审核,并为设计在社区价值与用户个人偏好之间取得平衡的审核系统提供了新方向。
引用
@article{arxiv.2602.05187,
title = {SpectraKAN: Conditioning Spectral Operators},
author = {Chun-Wun Cheng and Carola-Bibiane Schönlieb and Angelica I. Aviles-Rivero},
journal= {arXiv preprint arXiv:2602.05187},
year = {2026}
}