更安全的AI内容 moderation:通过统一基准数据集评估 LLM Moderator 并倡导以人类为中心的 метод
人工智能
2026-01-13 v1
摘要
随着AI系统越来越多地融入日常生活,安全可靠的 moderation 需求�发酥。大型语言模型(LLM)在复杂性和性能方面已超过先前模型。它们在各类任务上的评估始终展示了其潜力,使开发出具有适应性和个性化智能体的能力成为可能。然而,尽管这些进步正在发生,LLM 在需要细腻道德推理的领域仍然容易出错。它们在检测隐性仇恨、冒犯性语言和性别偏见方面困难,因为这些问题具有主观性和情境依赖性。此外,它们依赖于训练数据,可能无意中强化社会偏见,导致输出中出现不一致和伦理问题。为探索 LLM 在这一角色中的局限性,我们基于最先进(SOTA)模型开发了一个实验框架,用于评估人类情绪和冒犯行为。该框架引入了一个统一的基准数据集,涵盖49个不同的类别,涵盖人类情绪的广泛谱系、冒犯和仇恨文本以及性别和种族偏见。此外,我们引入了SafePhi,这是一个基于QLoRA微调的Phi-4版本,适应多样化的伦理情境,并通过实现Macro F1得分0.89,超越基准 moderation 模型,其中OpenAI Moderator和Llama Guard分别得分0.77和0.74。该研究还突出了LLM moderation 模型持续表现不佳的关键领域,促使我们采用更具代表性和多样性的数据,并引入人类在环(human-in-the-loop),以实现更好的模型鲁棒性和可解释性。
引用
@article{arxiv.2508.07063,
title = {Towards Safer AI Moderation: Evaluating LLM Moderators Through a Unified Benchmark Dataset and Advocating a Human-First Approach},
author = {Naseem Machlovi and Maryam Saleki and Innocent Ababio and Ruhul Amin},
journal= {arXiv preprint arXiv:2508.07063},
year = {2026}
}