中文

将有偏标注者能力估计模型应用于 COVID-19 疫苗推特数据:潜在消息特征的人工标注

应用统计 2025-04-03 v4 统计计算

摘要

传统的定量内容分析方法(人工编码方法)存在弱点,例如假设一旦训练达到编码者间信度阈值,所有人工编码员的准确性就相同。我们应用了有偏标注者能力估计(BACE)模型(Tyler, 2021),该模型利用贝叶斯建模来改进人工编码。该模型的一个重要贡献是考虑了每个编码员的潜在偏差和可靠性,并将每条消息的“真实”标签视为一个潜在参数,具有可量化的估计不确定性。相比之下,在传统的人工编码中,每条消息会获得一个固定的标签,而没有测量不确定性的估计。在这篇扩展摘要中,我们首先总结了传统人工编码的弱点;然后将 BACE 模型应用于 COVID-19 疫苗推特数据,并将 BACE 与其他统计模型进行比较;最后,我们讨论了如何应用 BACE 模型来改进潜在消息特征的人工编码。

关键词

引用

@article{arxiv.2302.09482,
  title  = {Adoption and implication of the Biased-Annotator Competence Estimation (BACE) model into COVID-19 vaccine Twitter data: Human annotation for latent message features},
  author = {Luhang Sun and Yun-Shiuan Chuang and Yibing Sun and Sijia Yang},
  journal= {arXiv preprint arXiv:2302.09482},
  year   = {2025}
}