测试 ChatGPT 用于文本标注与分类的可靠性:一项警示性评述
计算与语言
2023-04-24 v1
摘要
近期研究已展示 ChatGPT 在各种文本标注与分类任务中的 promising 潜力。然而,ChatGPT 是非确定性的,这意味着与人类标注者一样,相同的输入可能导致不同的输出。鉴于此,测试 ChatGPT 的可靠性似乎是恰当的。因此,本研究调查了 ChatGPT 零样本文本标注与分类能力的一致性,重点关注不同的模型参数、提示变体以及相同输入的重复。基于将网站文本区分为新闻与非新闻这一真实世界分类任务,结果表明 ChatGPT 分类输出的一致性可能达不到科学上的可靠性阈值。例如,即使是提示中细微的措辞改动或重复相同输入,都可能导致不同的输出。尽管汇总多次重复的输出可以提高可靠性,但本研究建议在使用 ChatGPT 进行零样本文本标注时保持谨慎,并强调需要进行彻底验证,例如与人工标注数据进行比较。不建议将 ChatGPT 无监督地应用于文本标注与分类。
引用
@article{arxiv.2304.11085,
title = {Testing the Reliability of ChatGPT for Text Annotation and Classification: A Cautionary Remark},
author = {Michael V. Reiss},
journal= {arXiv preprint arXiv:2304.11085},
year = {2023}
}
备注
First uploaded on Dropbox on 5th of April. See https://twitter.com/mv_reiss/status/1643916531720486913, content was not changed except for formatting