从引语到概念:使用集成语言模型对政治辩论进行主轴编码
计算与语言
2026-01-23 v1
摘要
主轴编码是一种常用的定性分析方法,通过将句子级的开放式编码组织成更广泛的类别来增强文档理解。在本文中,我们使用大语言模型(LLMs)将主轴编码操作化。我们将基于集成的开放式编码方法与 LLM 主持人相结合,增加了一个主轴编码步骤,将开放式编码分组为高阶类别,从而将原始辩论记录转换为简洁的分层表示。我们比较了两种策略: 使用基于密度和划分算法对编码-话语对的嵌入进行聚类,随后进行 LLM 标注; 直接使用 LLM 将编码和话语分组为类别。我们将该方法应用于荷兰议会辩论,将冗长的记录转换为紧凑的、分层结构的编码和类别。我们使用与人工分配的主题标签相一致的外部指标(ROUGE-L、余弦相似度、BERTScore)以及描述编码组内部特征的内在指标(覆盖率、简洁性、连贯性、新颖性、JSD 散度)来评估我们的方法。我们的结果揭示了一种权衡:基于密度的聚类实现了高覆盖率和强聚类一致性,而直接的 LLM 分组产生更高的细粒度一致性,但覆盖率低 20%。总体而言,聚类最大化了覆盖率和结构分离,而 LLM 分组产生了更简洁、可解释且语义一致的类别。为了支持未来的研究,我们公开发布了完整的话语和编码数据集,以实现可复现性和比较研究。
引用
@article{arxiv.2601.15338,
title = {From Quotes to Concepts: Axial Coding of Political Debates with Ensemble LMs},
author = {Angelina Parfenova and David Graus and Juergen Pfeffer},
journal= {arXiv preprint arXiv:2601.15338},
year = {2026}
}
备注
Accepted to ECIR2026