中文

代码本缩减与饱和:大型语言模型归纳主题饱和及主题分析初始编码的新观察

计算与语言 2025-03-10 v1 人工智能 计算机与社会

摘要

本文探讨了使用大型语言模型(LLMs)执行主题分析的过程。具体而言,该论文关注由LLMs产生的初始编码的分析饱和问题。主题分析是一种成熟的定性分析方法,由相互关联的阶段组成。一个关键阶段是初始编码,分析人员为数据集的离散成分分配标签。饱和是衡量定性分析有效性的方式,与初始编码的重复出现有关。本文反思了LLMs在分析饱和方面的表现,并提出了一种测量归纳主题饱和(ITS)的新技术。该新技术利用了一个名为DSPy的编程框架。所提出的新方法允许对ITS进行精确测量。

关键词

引用

@article{arxiv.2503.04859,
  title  = {Codebook Reduction and Saturation: Novel observations on Inductive Thematic Saturation for Large Language Models and initial coding in Thematic Analysis},
  author = {Stefano De Paoli and Walter Stan Mathis},
  journal= {arXiv preprint arXiv:2503.04859},
  year   = {2025}
}