计算测量政治位置:基于文本的理想点估计算法综述
机器学习
2025-12-05 v1 人工智能
计算与语言
计算机与社会
摘要
本文对无监督和半监督计算文本理想点估计(CT-IPE)算法进行首次系统性综述。这些算法用于从文本数据中推断潜在政治位置,在政治学、传播学、计算社会科学和计算机科学中广泛应用。过去二十年间,其发展紧随 NLP 趋势——从词频模型到最新的大语言模型(LLM)。尽管这种轨迹极大扩展了方法工具箱,但也导致领域碎片化,缺乏系统比较和明确的应用指导。为填补这一空白,我们通过系统文献综述识别了 25 个 CT-IPE 算法,并对其建模假设和开发背景进行手动内容分析。为实现有意义比较,我们引入概念框架,区分算法如何生成、捕捉和聚合文本方差。基于此,我们识别出四类方法——词频、主题建模、词嵌入和 LLM 方法——并批判性评估了它们的假设、可解释性、可扩展性和局限性。本综述作出三大贡献:首先,提供两十年算法发展的结构化综述,阐明不同方法之间的关系;其次,将这些洞见转化为实际应用指导,突出透明度、技术要求和验证策略之间的权衡,影响算法选择;最后,强调不同算法间估计结果差异本身具有信息价值,强调系统性基准测试的必要性。
引用
@article{arxiv.2511.13238,
title = {Computational Measurement of Political Positions: A Review of Text-Based Ideal Point Estimation Algorithms},
author = {Patrick Parschan and Charlott Jakob},
journal= {arXiv preprint arXiv:2511.13238},
year = {2025}
}
备注
46 pages, 8 figures, 2 tables, accepted for publication in Quality & Quantity