解码规则手册:从 Reddit 社区提取隐藏的审核标准
计算与语言
2025-09-04 v1
摘要
有效的内容审核系统需要明确的分类标准,然而像 subreddit 这样的在线社区往往在不同的隐性标准下运行。本研究引入了一种新方法,使用可解释的架构从历史审核数据中识别并提取这些隐性标准。我们将审核标准表示为与内容移除相关的词汇表达评分表,从而能够对不同社区进行系统比较。我们的实验表明,这些提取的词汇模式在提供对决策过程的透明洞察的同时,有效地复现了神经审核模型的性能。生成的标准矩阵揭示了看似共享的规范在实际执行中的显著差异,发现了以前未记录的审核模式,包括社区特定的语言容忍度、主题限制特征以及有毒语音分类的潜在子类别。
引用
@article{arxiv.2509.02926,
title = {Decoding the Rule Book: Extracting Hidden Moderation Criteria from Reddit Communities},
author = {Youngwoo Kim and Himanshu Beniwal and Steven L. Johnson and Thomas Hartvigsen},
journal= {arXiv preprint arXiv:2509.02926},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main