评估大语言模型检测反犹太主义内容的能力
计算与语言
2025-11-06 v2 人工智能
计算机与社会
摘要
检测仇恨内容是一个具有挑战性的重要问题。自动化工具(如机器学习模型)可以提供帮助,但它们需要持续训练以适应不断变化的社交媒体格局。在本工作中,我们评估了八个开源大语言模型(LLM)检测反犹太主义内容的能力,特别利用了上下文定义。我们还研究了 LLM 在给定审核策略作为指南的情况下如何理解和解释其决策。首先,我们探索了各种提示技术,并设计了一种新的类思维链提示——引导式思维链(Guided-CoT),发现注入领域特定的想法可以提高性能和效用。Guided-CoT 能够很好地处理上下文策略,通过减少所有被评估模型的拒绝响应来提高性能和效用,无论解码配置、模型规模或推理能力如何。值得注意的是,Llama 3.1 70B 的表现优于微调的 GPT-3.5。此外,我们检查了 LLM 的错误,并引入了量化模型生成推理中语义分歧的指标,揭示了 LLM 之间的显著差异和矛盾行为。我们的实验突出了 LLM 在效用、可解释性和可靠性方面的差异。代码和资源可在以下网址获取:https://github.com/idramalab/quantify-llm-explanations
引用
@article{arxiv.2509.18293,
title = {Evaluating Large Language Models for Detecting Antisemitism},
author = {Jay Patel and Hrudayangam Mehta and Jeremy Blackburn},
journal= {arXiv preprint arXiv:2509.18293},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main Conference