中文

什么是抗议?在大语言模型时代的代码本体化仍是分类的首要关切

计算与语言 2025-10-07 v1

摘要

生成式大语言模型(LLM)如今已被广泛用于计算社会科学中的文本分类。在本工作中,我们关注LLM提示之前后的步骤——即概念的概念化以及使用LLM预测进行下游统计推断——我们认为这些步骤在大量LLM时代的计算社会科学研究中被忽视了。我们指出,LLM会使分析人员倾向于跳过概念化步骤,从而导致概念化错误,这些错误会偏导下游估计。通过仿真实验,我们展示,这种由概念化引起的偏差不能仅通过提高LLM的准确性或事后偏差纠正方法来纠正。我们通过提醒计算社会科学分析师,概念化在LLM时代仍是首要关切,并提供具体建议,以实现低成本、无偏、低方差的下游估计。

关键词

引用

@article{arxiv.2510.03541,
  title  = {What is a protest anyway? Codebook conceptualization is still a first-order concern in LLM-era classification},
  author = {Andrew Halterman and Katherine A. Keith},
  journal= {arXiv preprint arXiv:2510.03541},
  year   = {2025}
}