使用不完美替代变量进行下游推断:面向大语言模型社会科学应用的设计型监督学习
统计方法学
2024-01-17 v3 计算与语言
机器学习
机器学习
摘要
在计算社会科学(CSS)中,研究者分析文档以解释社会与政治现象。在大多数场景中,CSS研究者首先获取文档标签,然后在第二步使用可解释的回归分析解释标签。一种日益常见的低成本大规模标注文档的方式是通过大语言模型(LLMs)。然而,如同其他可扩展的标注生成方式,此类替代标签往往不完美且有偏。我们提出一种新算法,用于在不完美标注替代变量下进行下游统计分析,同时保证统计性质——如渐近无偏性与恰当的不确定性量化——这些对CSS研究至关重要。我们表明,在下游统计分析中直接使用替代标签会导致显著偏差与无效的置信区间,即使替代准确率高达80-90%。为此,我们基于去偏机器学习提出设计型监督学习(DSL)估计量。DSL采用双重稳健过程,将替代标签与少量高质量金标准标签相结合。我们的方法通过对金标准标注文档抽样概率的控制,保证下游统计分析的有效推断,即使替代变量有任意偏差且无需严格假设。我们的理论分析与实验结果均表明,DSL提供有效的统计推断,同时达到与现有仅关注预测而无推断保证的替代方法相当的均方根误差。
引用
@article{arxiv.2306.04746,
title = {Using Imperfect Surrogates for Downstream Inference: Design-based Supervised Learning for Social Science Applications of Large Language Models},
author = {Naoki Egami and Musashi Hinck and Brandon M. Stewart and Hanying Wei},
journal= {arXiv preprint arXiv:2306.04746},
year = {2024}
}
备注
37th Conference on Neural Information Processing Systems (NeurIPS 2023)