中文

提问以获得:用于预测线内容侵犯的问答框架

计算机与社会 2025-10-09 v1 人工智能 计算与语言 人机交互 机器学习

摘要

在线社区依赖平台政策和社区作者编写的规则来定义可接受行为并维持秩序。然而,这些规则在不同社区间差异巨大,随时间演变且执行不一致,这给透明度、治理和自动化带来挑战。本文构建了规则与其执行在规模上的关系模型,引入 ModQ——一种 novel 问答框架,用于规则敏感的内容审查。与 prior classification 或 generation-based 方法不同,ModQ 在推理时以完整的社区规则为条件,并识别哪条规则最适用于给定评论。我们实现了两种模型变体——抽取式和多选式 QA,并在来自 Reddit 和 Lemmy 的大规模数据集上进行训练,后者我们从公开可用的 moderation 日志和规则描述中构建。两种模型在识别 moderation 相关规则违规方面均超越了 state-of-the-art 的基线方法,同时保持轻量级和可解释性。值得注意的是,ModQ 模型对未见的社区和规则具有良好的泛化能力,支持低资源的审查环境和动态治理环境。

关键词

引用

@article{arxiv.2510.06350,
  title  = {Asking For It: Question-Answering for Predicting Rule Infractions in Online Content Moderation},
  author = {Mattia Samory and Diana Pamfile and Andrew To and Shruti Phadke},
  journal= {arXiv preprint arXiv:2510.06350},
  year   = {2025}
}

备注

Accepted at ICWSM 2026