中文

评估大型语言模型在演绎定性编码中的可靠性:ChatGPT 干预方法的比较研究

人机交互 2025-07-22 v1 计算与语言

摘要

本研究探讨了大型语言模型 (LLM), Specifically ChatGPT,用于结构化演绎定性编码的潜力。虽然当前大多数研究侧重于归纳编码应用,但我们聚焦于 LLM 执行与既定人类编码方案一致的演绎分类任务的未探索潜力。我们采用 Comparative Agendas Project (CAP) Master Codebook,对美国最高法院案例摘要进行 21 个主要政策领域的分类。我们测试了四种干预方法:零样本、few-shot、定义-based 以及一种新颖的逐步任务分解策略,进行多次抽样。性能通过标准分类指标 (准确率、F1 分数、Cohen's Kappa、Krippendorff's Alpha) 进行评估,构建有效性通过卡方检验和 Cramer's V 进行评估。卡方检验和效应大小分析确认,干预策略显著影响了分类行为,Cramer's V 值范围为 0.359 到 0.613,表明分类模式存在中等到强烈的偏移。逐步任务分解策略实现了最佳可靠性 (准确率 = 0.775, Kappa = 0.744, Alpha = 0.746),达到实质一致性阈值。尽管案例摘要存在语义模糊性,ChatGPT 在抽样间的稳定一致性方面表现良好,包括在低支持子类中取得高 F1 分数。这一发现表明,在有针对性且自定义的干预下,LLM 能够实现适用于严格定性编码工作流程的可靠性水平。

关键词

引用

@article{arxiv.2507.14384,
  title  = {Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparative Study of ChatGPT Interventions},
  author = {Angjelin Hila and Elliott Hauser},
  journal= {arXiv preprint arXiv:2507.14384},
  year   = {2025}
}

备注

Extended version of paper accepted for presentation at the ASIS&T Annual Meeting 2025. 38 pages, 12 figures