中文

通过社区驱动的多智能体框架改进隐式仇恨言论检测

计算与语言 2026-01-28 v2 人工智能

摘要

本工作提出了一个针对隐式仇恨言论的情境化检测框架,实现为一个由中央 Moderator Agent 和代表特定人口群体的动态构建的 Community Agents 组成的多智能体系统。我们的方法显式地整合了来自公开知识源的社会文化语境,实现了超越最先进提示方法(zero-shot prompting、few-shot prompting、chain-of-thought prompting)及替代方法的身份感知审核,并在具有挑战性的 ToxiGen 数据集上进行了验证。我们通过将 balanced accuracy 作为衡量分类公平性的核心指标(该指标考虑了真阳性率与真阴性率之间的权衡),增强了性能评估的技术严谨性。我们证明了我们社区驱动的协商框架在所有目标群体上均显著提升了分类准确性与公平性。

关键词

引用

@article{arxiv.2601.09342,
  title  = {Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework},
  author = {Ewelina Gajewska and Katarzyna Budzynska and Jarosław A Chudziak},
  journal= {arXiv preprint arXiv:2601.09342},
  year   = {2026}
}

备注

This paper has been accepted for the upcoming 18th International Conference on Agents and Artificial Intelligence (ICAART-2026), Marbella, Spain. The final published version will appear in the official conference proceedings