内容审查的战略过滤:言论自由还是无失真?
机器学习
2025-07-29 v1 计算机科学与博弈论
摘要
用户生成内容 (UGC) 在社交媒体平台上易受煽动与操纵威胁,亟需有效监管。为应对这些挑战,平台常部署自动内容审查系统,对 UGC 的有害性进行评估并过滤违反既定准则的内容。然而,这种审查必然引发用户的策略性回应,用户致力于在准则限制内表达自我。此现象要求在以下方面进行权衡:1. 确保言论自由——通过最小化表达限制;2. 减少社会失真——以总量衡量内容操纵。我们通过机制设计的视角解决此问题,旨在优化最小化社会失真与最大化言论自由之间的权衡。虽然确定最优权衡是 NP-hard 的,但我们提出实用方法近似求解最优解。此外,我们提供了概括保证,确定近似有效的审查器所需的有限离线数据量。
引用
@article{arxiv.2507.20061,
title = {Strategic Filtering for Content Moderation: Free Speech or Free of Distortion?},
author = {Saba Ahmadi and Avrim Blum and Haifeng Xu and Fan Yao},
journal= {arXiv preprint arXiv:2507.20061},
year = {2025}
}