中文

利用国会演讲检验政治偏见的机器学习流水线

计算机与社会 2021-09-21 v1 计算与语言 机器学习

摘要

对社交媒体中政治偏见建模的计算方法面临诸多挑战,源于数据的异质性、高维性、多模态及规模。社交媒体的政治偏见已从媒体偏见、政治意识形态、回音室和争议等多种视角,借助机器学习流水线加以研究。当前多数方法严重依赖用于底层政治偏见预测任务的手动标注真值数据。此类方法的局限包括人工密集型标注、标签仅关联特定问题,以及无法判定社交媒体对话在不久的将来的偏见状态。本工作中,我们解决上述问题,给出在两种意识形态多元的社交媒体论坛 Gab 与 Twitter 上研究政治偏见的机器学习方法,且无需人工标注数据。我们提出的方法利用从美国国会政治演讲中收集的转录文本来标注数据,在 Twitter 与 Gab 数据上分别取得 70.5% 与 65.1% 的最高准确率以预测政治偏见。我们还提出一种结合级联与文本特征的机器学习方法,以约 85% 的准确率预测级联的政治偏见。

关键词

引用

@article{arxiv.2109.09014,
  title  = {A Machine Learning Pipeline to Examine Political Bias with Congressional Speeches},
  author = {Prasad hajare and Sadia Kamal and Siddharth Krishnan and Arunkumar Bagavathi},
  journal= {arXiv preprint arXiv:2109.09014},
  year   = {2021}
}