聊天机器人是可靠的文本标注器吗?有时是
计算与语言
2025-02-26 v2 人工智能
摘要
近期研究凸显了 ChatGPT 在社会科学研究中文本标注的巨大潜力。然而,ChatGPT 是闭源产品,在透明度、可复现性、成本和数据保护方面存在重大缺陷。开源(OS)大语言模型(LLMs)的最新进展提供了一种无这些缺陷的替代方案。因此,评估 OS LLMs 相对于 ChatGPT 以及监督机器学习分类标准方法的性能十分重要。我们对一系列 OS LLMs 与 ChatGPT 的性能进行了系统比较评估,使用零样本和少样本学习以及通用和自定义提示,结果与监督分类模型进行比较。利用一个来自美国新闻媒体的推文新数据集,并聚焦于简单二值文本标注任务,我们发现 ChatGPT 和 OS 模型在各任务上的性能存在显著差异,且使用 DistilBERT 的监督分类器通常优于两者。鉴于 ChatGPT 不可靠的性能及其对开放科学带来的重大挑战,我们建议在进行实质性文本标注任务时使用 ChatGPT 需谨慎。
引用
@article{arxiv.2311.05769,
title = {Are Chatbots Reliable Text Annotators? Sometimes},
author = {Ross Deans Kristensen-McLachlan and Miceal Canavan and Márton Kardos and Mia Jacobsen and Lene Aarøe},
journal= {arXiv preprint arXiv:2311.05769},
year = {2025}
}
备注
Accepted for publication in PNAS Nexus (accepted Feb. 2025)