中文

面向组织研究的有害内容检测:集成大型语言模型的 Elo 评分系统

人工智能 2025-06-23 v1 计算与语言

摘要

大型语言模型 (LLM) 为组织研究提供了前景的机会。然而,它们内置的 moderation 系统在研究人员尝试分析有害内容时会造成问题,常常拒绝遵从某些指令或产生过于谨慎的响应,从而削弱结果的有效性。这在分析组织冲突(如微歧视或仇恨言论)时尤其棘手。本文引入一种基于 Elo 评分的方法,显著提升了 LLM 在有害内容分析方面的性能。在两个数据集上进行测试,一个聚焦于微歧视检测,另一个聚焦于仇恨言论,我们发现该方法在准确率、精确率和 F1 分数等关键指标上超越了传统 LLM 提示技术和常规机器学习模型。优势包括在分析有害内容时更可靠,误报更少,以及对大规模数据集的更好扩展性。该方法支持组织应用,包括检测职场骚扰、评估有毒沟通以及营造更安全更包容的工作环境。

关键词

引用

@article{arxiv.2506.16575,
  title  = {Advancing Harmful Content Detection in Organizational Research: Integrating Large Language Models with Elo Rating System},
  author = {Mustafa Akben and Aaron Satko},
  journal= {arXiv preprint arXiv:2506.16575},
  year   = {2025}
}

备注

Submitted for HICSS 2025 (Hawaii International Conference on System Sciences); under review