中文

基于大语言模型的参数估计去偏方法基准测试

计算与语言 2025-09-22 v2

摘要

大语言模型(LLM)提供了一种廉价而强大的文本标注方式,但与专家相比往往不一致。这些误差可能会对总体参数的估计(如回归系数和因果效应)产生偏差。为缓解这种偏差,研究人员开发了基于设计的监督学习(DSL)和预测驱动推断(PPI)等去偏方法,这些方法通过将 LLM 标注与少量昂贵的专家标注相结合,承诺提供有效的估计。尽管这些方法在理论假设下产生一致的估计,但在应用研究中遇到的有限样本规模下它们的表现尚不清楚。我们做出了两项贡献。第一,我们研究了每种方法的性能如何随专家标注数量扩展,突出了 LLM 偏差或有限专家标签显著影响结果的区域。第二,我们在多种任务上比较了 DSL 和 PPI,发现尽管两者在大数据集上均实现了低偏差,但 DSL 通常在偏差减少和实证效率方面优于 PPI,但其性能在不同数据集上的一致性较差。我们的结果表明去偏方法层面存在偏差-方差权衡,呼吁更多研究来开发衡量其在有限样本中效率的指标。

关键词

引用

@article{arxiv.2506.09627,
  title  = {Benchmarking Debiasing Methods for LLM-based Parameter Estimates},
  author = {Nicolas Audinet de Pieuchon and Adel Daoud and Connor T. Jerzak and Moa Johansson and Richard Johansson},
  journal= {arXiv preprint arXiv:2506.09627},
  year   = {2025}
}

备注

To appear as: Nicolas Audinet de Pieuchon, Adel Daoud, Connor T. Jerzak, Moa Johansson, Richard Johansson. Benchmarking Debiasing Methods for LLM-based Parameter Estimates. In: Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP), 2025