中文

SLM-Mod:小型语言模型在内容审查中超越大语言模型

计算与语言 2025-02-11 v2

摘要

大语言模型 (LLM) 在众多自然语言理解任务中展现出前景,包括内容审查。然而,这些模型在实时查询方面昂贵且不允许社区特定的内容审查方法。为解决这些挑战,我们探索了使用开源小型语言模型 (SLM) 用于社区特定内容审查任务。我们通过在零样本和 few-shot 情况下将 SLM (参数不足 15B) 与 much larger open- 和 closed-sourced 模型进行比较来进行微调和评估。使用来自 15 个热门 Reddit 社区的 15 万条评论,我们发现 SLM 在内容审查方面优于零样本 LLM——平均 across all communities,准确率提高 11.5%,召回率提高 25.7%。此外,few-shot 上下文学习仅略微提高 LLM 的性能,仍不及 SLM。我们进一步展示了跨社区内容审查的潜力,这对新社区和跨平台审查技术的开发具有意义。最后,我们概述了基于语言模型的内容审查的未来工作方向。代码和模型可在 https://github.com/AGoyal0512/SLM-Mod 上找到。

关键词

引用

@article{arxiv.2410.13155,
  title  = {SLM-Mod: Small Language Models Surpass LLMs at Content Moderation},
  author = {Xianyang Zhan and Agam Goyal and Yilun Chen and Eshwar Chandrasekharan and Koustuv Saha},
  journal= {arXiv preprint arXiv:2410.13155},
  year   = {2025}
}

备注

NAACL 2025 (Main): 17 pages, 8 figures, 10 tables