利用大语言模型进行可扩展的定性编码:思维链推理在某些诠释任务中媲美人类表现
计算与语言
2024-02-14 v2 人工智能
摘要
定性编码,或称内容分析,从文本中提取意义,以辨别整个文本语料库中的定量模式。最近,大语言模型(LLMs)在解释能力方面的进步为自动化编码过程(将类别标签应用于文本)提供了潜力,从而使人类研究者能够专注于更具创造性的研究方面,同时将这些解释性任务委托给 AI。我们的案例研究包含一组社会历史编码,应用于代表一项人文学科研究的密集、段落长度的段落。我们表明,GPT-4 能够进行与人类等效的解释,而 GPT-3.5 则不能。与我们人类衍生的黄金标准相比,GPT-4 在 9 个编码中的 3 个上提供了极好的编码者间信度(Cohen's ),在 9 个编码中的 8 个上提供了实质性的信度()。相比之下,GPT-3.5 在所有编码上的表现都大大低于标准(;)。重要的是,我们发现当提示 LLM 给出证明其编码决策的理由(思维链推理)时,编码保真度显著提高。我们呈现了这些发现以及其他发现,并附有一套为 LLM 改编传统编码簿的最佳实践。我们的结果表明,对于某些编码簿,最先进的 LLM 已经能够熟练地进行大规模内容分析。此外,它们表明下一代模型可能会使 AI 编码成为大多数编码簿的可行选择。
引用
@article{arxiv.2401.15170,
title = {Scalable Qualitative Coding with LLMs: Chain-of-Thought Reasoning Matches Human Performance in Some Hermeneutic Tasks},
author = {Zackary Okun Dunivin},
journal= {arXiv preprint arXiv:2401.15170},
year = {2024}
}