MoMoE:面向AI辅助在线治理的混合审核专家框架
计算与语言
2025-10-24 v2
摘要
大型语言模型 (LLM) 在标记在线社区有害内容方面展现出巨大潜力。然而,现有的审核方法要求每个社区配备一个单独的模型,且其决策过程不透明,限制了其在现实世界中的应用。我们提出了混合审核专家框架 (Mixture of Moderation Experts, MoMoE),这是一个模块化的跨社区框架,为可扩展的内容审核增加了事后解释。MoMoE 编排了四个算子——分配、预测、聚合、解释——并被实例化为七个社区专属专家 (MoMoE-Community) 和五个违规规范专家 (MoMoE-NormVio)。在30个未见过的 subreddit 上,最佳变体分别获得了0.72和0.67的 Micro-F1 分数,匹配或超越了强大的微调基线,同时持续产生简洁可靠的解释。尽管社区专属专家提供了最高的峰值准确率,但违规规范专家在跨领域上提供了更稳定的性能。这些发现表明,MoMoE 无需针对每个社区进行微调即可实现可扩展、透明的审核。更广泛地说,它们表明轻量级、可解释的专家集成可以指导未来关于在线社区可信人机治理的 NLP 和 HCI 研究。
引用
@article{arxiv.2505.14483,
title = {MoMoE: Mixture of Moderation Experts Framework for AI-Assisted Online Governance},
author = {Agam Goyal and Xianyang Zhan and Yilun Chen and Koustuv Saha and Eshwar Chandrasekharan},
journal= {arXiv preprint arXiv:2505.14483},
year = {2025}
}
备注
EMNLP 2025 (Oral)