政治内容文本标注的 LLM 基准测试:以毒性和不文明数据为例
计算与语言
2024-09-17 v1 人工智能
摘要
本文基准测试了 OpenAI 的 GPTs 以及多种开源 LLM 执行政治内容文本标注任务的能力。我们使用包括超过三百万数字交互的新型示威事件数据集,并创建了包含由人类编码师标注的毒性和不文明标签的金标准。我们的基准测试包括 Google 的 Perspective 算法,该算法以及 GPTs 通过各自的 API 被用于,而开源 LLM 则在本地部署。研究结果表明,Perspective API 使用宽松阈值、GPT-4o 以及 Nous Hermes 2 Mixtral 在零样本分类标注方面均优于其他 LLM。此外,Nous Hermes 2 和 Mistral OpenOrca 参数较少,却能够以高性能完成此任务,作为在性能、实施成本和计算时间之间的优势性选项备受青睐。附加研究通过设置不同的温度水平表明,尽管 GPTs 表现出卓越的计算效率以及总体良好的可靠性,但只有开源 LLM 能确保标注的完全可重复性。
引用
@article{arxiv.2409.09741,
title = {Benchmarking LLMs in Political Content Text-Annotation: Proof-of-Concept with Toxicity and Incivility Data},
author = {Bastián González-Bustamante},
journal= {arXiv preprint arXiv:2409.09741},
year = {2024}
}
备注
Paper prepared for delivery at the 8th Monash-Warwick-Zurich Text-as-Data Workshop, September 16-17, 2024: 11 pages, 3 tables, 3 figures