基于文本嵌入的可扩展且一致的少样本分类方法
计算与语言
2025-08-28 v1 物理教育
摘要
开放式调查问卷的定性分析是社会科学中常用的方法,但传统编码方法往往耗时且容易不一致。自然语言处理中的现有解决方案(如监督式分类器、主题建模技术和生成式大语言模型)在定性分析中应用受限,原因在于它们需要大量标注数据、干扰既定的定性工作流程,或产生结果不稳定。本文引入一种基于文本嵌入的分类框架,仅需每个类别少量示例,即可适配标准的定性工作流程。该框架在对包含 2899 条开放式回答的概念物理学调查问卷进行人类分析后,以 Cohen's Kappa 值为 0.74 到 0.83(相对于专家人类编码者),实现了详尽编码方案的评估。我们进一步展示该框架在对文本嵌入模型进行微调后性能如何提升,以及如何用于审计已分析的数据集。这些发现表明,文本嵌入辅助的编码能够在不牺牲可解释性的前提下扩展到数千条回答,为大规模的推演定性分析开辟了新途径。
关键词
引用
@article{arxiv.2508.19836,
title = {Scalable and consistent few-shot classification of survey responses using text embeddings},
author = {Jonas Timmann Mjaaland and Markus Fleten Kreutzer and Halvor Tyseng and Rebeckah K. Fussell and Gina Passante and N. G. Holmes and Anders Malthe-Sørenssen and Tor Ole B. Odden},
journal= {arXiv preprint arXiv:2508.19836},
year = {2025}
}