通过 LLM 驱动的反事实仿真评估线上 moderation
人工智能
2026-04-01 v1 计算机与社会
多智能体系统
摘要
线上社交网络(OSNs)广泛采用内容 moderation 来缓解有害和有毒话语的传播。然而,由于数据收集成本高且实验控制有限,moderation 干预的真实效果仍不明确。最新的自然语言处理技术为新的评估方法开辟了道路。大型语言模型(LLMs)可以成功地用于增强主动建模,模拟具有前所未有程度可信度的人类社会行为。然而,现有工具不支持基于仿真的 moderation 策略评估。我们通过设计一个 LLM 驱动的 OSN 对话模拟器,实现一个平行的、反事实的仿真场景,其中有毒行为受到 moderation 干预的影响,保持其他条件不变。我们进行了大量实验,揭示了 OSN 代理的心理现实性、社交传染现象的出现以及个性化 moderation 策略的优越效果。
引用
@article{arxiv.2511.07204,
title = {Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations},
author = {Giacomo Fidone and Lucia Passaro and Riccardo Guidotti},
journal= {arXiv preprint arXiv:2511.07204},
year = {2026}
}
备注
Accepted for publication at AAAI Conference on Artificial Intelligence 2026