魔法词语还是方法性工作?挑战基于大语言模型的政治文本标注中的常识
计算与语言
2026-04-01 v2 人工智能
机器学习
摘要
政治科学家们正快速采用大语言模型 (LLM) 进行文本标注,但标注结果对实现选择的敏感性仍鲜有了解。大多数评估仅测试单个模型或配置;模型选择、模型规模、学习方法和提示样式之间的相互作用,以及流行的"最佳实践"是否在受控比较下仍然成立,仍 largely 未被探索。我们对这些管道选择进行受控评估,在相同的量化、硬件和提示模板条件下,测试六个开源模型跨越四个政治科学标注任务。我们的核心发现是方法论的:显著性效应支配主要效应,因此看似合理的管道选择可能变得决定性的研究自由度。没有单个模型、提示样式或学习方法在所有情境下都 uniformly 更优秀,表现最好的模型会因任务而异。首先,模型规模是不可靠的指标,既用于成本,也用于性能:跨家族的效率差异如此之大,以至于一些更大的模型比更小的替代方案更少耗资源,而在同一模型家族内部,中等规模变体常常匹配甚至超过更大规模的版本。其次,广泛推荐的提示工程技术对标注性能产生不一致甚至负面影响。我们利用这些基准结果发展出一种以验证为导向的框架——包括管道决策的原则性排序、关于提示冻结和留出评估的指导方针、报告标准以及开源工具——以帮助研究人员在这个决策空间中透明地导航。
引用
@article{arxiv.2603.26898,
title = {Magic Words or Methodical Work? Challenging Conventional Wisdom in LLM-Based Political Text Annotation},
author = {Lorcan McLaren and James Cross and Zuzanna Krakowska and Robin Rauner and Martijn Schoonvelde},
journal= {arXiv preprint arXiv:2603.26898},
year = {2026}
}