量化公共话语 LLM 立场分析中不稳定性的来源
计算与语言
2026-07-12 v1
摘要
计算社会科学越来越依赖自动化预处理流水线——说话人日志化、ASR 转录清洗、句子分割——将原始媒体转换为可分析的文本。当这些流水线对同一输入产生不同输出时,会出现两种不同的不稳定性来源:预处理流水线本身(日志化方法、分割规则)和下游测量工具(LLM 标注与关键词词典)。使用涵盖五个领域 41 位公众人物的 256 个 YouTube 访谈,我们比较了两种说话人日志化流水线和两种测量方法,所有这些均针对情感效价与认知情态之间的耦合。我们发现:(1) 预处理流水线敏感性集中在视频样本有限的说话人身上(N );对于四个采样最充分的说话人(N ),流水线引起的 平均绝对变化仅为 ;(2) 跨方法分歧更大且更系统——LLM 和关键词词典方法对几个采样充分的说话人分配了相反的耦合方向,即使在同一预处理流水线内也是如此;(3) 无论采用何种流水线或方法,总体效价比例都非常稳定(pp),掩盖了这两种不稳定性来源。本文的贡献在于提供了一个将流水线效应与测量效应分离的诊断框架:研究访谈数据中跨维度关系的研究人员应验证其结论对这两种变异来源均具有鲁棒性,并特别关注测量方法的选择。
引用
@article{arxiv.2607.10846,
title = {Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse},
author = {Bo Chen},
journal= {arXiv preprint arXiv:2607.10846},
year = {2026}
}