大语言模型检测有害计算术语的评估
计算与语言
2025-03-13 v1 新兴技术
摘要
在技术语境中检测有害和非包容性术语对于营造包容性的计算环境至关重要。本研究探讨了模型架构对有害语言检测的影响,通过评估一个经过精心策划的技术术语数据库,每个术语都配有特定的使用场景。我们测试了一系列编码器、解码器和编码器-解码器语言模型,包括BERT-base-uncased、RoBERTa large-mnli、Gemini Flash 1.5和2.0、GPT-4、Claude AI Sonnet 3.5、T5-large和BART-large-mnli。每个模型都接收了标准化提示,以识别64个术语中的有害和非包容性语言。结果表明,解码器模型,特别是Gemini Flash 2.0和Claude AI,在微妙的语境分析方面表现出色,而编码器模型如BERT在模式识别方面表现强劲,但在分类确定性方面存在困难。我们讨论了这些发现对改进自动检测工具的影响,并强调了模型在促进技术领域的包容性交流方面的特定优势和局限性。
引用
@article{arxiv.2503.09341,
title = {An Evaluation of LLMs for Detecting Harmful Computing Terms},
author = {Joshua Jacas and Hana Winchester and Alicia Boyd and Brittany Johnson},
journal= {arXiv preprint arXiv:2503.09341},
year = {2025}
}