中文

政策即提示:大语言模型时代内容审查的再思考

计算机与社会 2025-02-27 v1 人工智能 社会与信息网络

摘要

内容审查在塑造安全包容的线上环境中发挥着关键作用,需在平台标准、用户期望和监管框架之间进行平衡。传统方法涉及将政策转化为指南,以供下游人工审查员执行或进一步标注数据集以训练机器学习审查模型。然而,近期大语言模型(LLM)的发展正在改变这一格局。这些模型现在可以直接将政策解释为文本输入,无需进行大规模数据 curated。这种方法提供了前所未有的灵活性,由于自然语言交互,审查可以动态调整。本文在正式化政策即提示框架的基础上,识别了跨四个领域的五个关键挑战:技术实施(1. 将政策转化为提示、2. 对提示结构和格式的敏感性)、社会技术(3. 政策形成中的技术决定论风险)、组织(4. 政策与机器学习团队之间的角色演变)以及治理(5. 模型治理与问责制)。通过分析这些挑战在技术、社会技术、组织和治理维度上的表现,我们讨论了可能的缓解措施。本研究为实践者提供了可操作的见解,为数字生态系统中可扩展且自适应的内容审查系统的未来探索奠定了基础。

关键词

引用

@article{arxiv.2502.18695,
  title  = {Policy-as-Prompt: Rethinking Content Moderation in the Age of Large Language Models},
  author = {Konstantina Palla and José Luis Redondo García and Claudia Hauff and Francesco Fabbri and Henrik Lindström and Daniel R. Taber and Andreas Damianou and Mounia Lalmas},
  journal= {arXiv preprint arXiv:2502.18695},
  year   = {2025}
}

备注

14 pages, 5 figures