中文

从审核到调解:大语言模型能否充当在线骂战中的调解者?

人工智能 2026-03-02 v5

摘要

大语言模型的快速发展为 AI 向善应用开辟了新可能性。随着大语言模型越来越多地介入在线交流,其促进共情和建设性对话的潜力成为负责任 AI 研究的重要前沿。这项工作探讨了大语言模型是否不仅能作为检测有害内容的内容审核者,还能作为能够理解和缓和在线冲突的调解者。我们的框架将调解分解为两个子任务:判断,即大语言模型评估对话的公平性和情感动态,以及引导,即它生成共情的、缓和性的信息以引导参与者走向解决。为评估调解质量,我们构建了一个基于 Reddit 的大规模数据集,并提出了一种结合基于原则的评分、用户模拟和人工对比的多阶段评估流程。实验表明,在进行调解时,基于 API 的模型在推理和干预对齐方面均优于开源模型。我们的发现揭示了当前大语言模型作为新兴在线社会调解智能体的潜力与局限性。

关键词

引用

@article{arxiv.2512.03005,
  title  = {From Moderation to Mediation: Can LLMs Serve as Mediators in Online Flame Wars?},
  author = {Dawei Li and Abdullah Alnaibari and Arslan Bisharat and Manny Sandoval and Deborah Hall and Yasin Silva and Huan Liu},
  journal= {arXiv preprint arXiv:2512.03005},
  year   = {2026}
}

备注

Accepted by PAKDD 2026 special session on Data Science: Foundations and Applications