中文

过滤上下文缓解政治意识形态预测中的稀缺性与选择偏差

机器学习 2023-02-02 v1 计算与语言 机器学习

摘要

我们提出了一种新颖的监督学习方法用于政治意识形态预测 (PIP),能够预测分布外输入。该问题的动机在于人工数据标注成本高昂,而自我报告的标签往往稀缺且表现出显著的选择偏差。我们提出了一种新颖的统计模型,将文档嵌入分解为两个向量的线性叠加:一个与意识形态无关的潜在中性\emph{上下文}向量,以及一个与意识形态对齐的潜在\emph{立场}向量。我们训练了一个端到端模型,其以中间的上下文向量与立场向量作为输出。在部署时,我们的模型仅利用预测的立场向量为输入文档预测标签。在两个基准数据集上,我们表明即便仅使用少至 5% 的偏差数据训练,我们的模型也能输出预测,且显著优于当前最优方法。通过众包我们验证了上下文向量的中立性,并表明上下文过滤导致意识形态集中,从而实现对分布外样本的预测。

关键词

引用

@article{arxiv.2302.00239,
  title  = {Filtering Context Mitigates Scarcity and Selection Bias in Political Ideology Prediction},
  author = {Chen Chen and Dylan Walker and Venkatesh Saligrama},
  journal= {arXiv preprint arXiv:2302.00239},
  year   = {2023}
}