利用语言模型理解政治极化:一个数据集与方法
计算与语言
2023-01-04 v1
摘要
我们的论文旨在利用语言模型分析美国政治体系中的政治极化,从而帮助候选人做出明智决策。该信息的可用性将帮助选民理解其候选人在经济、医疗、教育及其他社会问题上的观点。我们的主要贡献是一个从维基百科提取的跨越过去120年的数据集,以及一种基于语言模型的方法,用于帮助分析候选人的极化程度。我们的数据分为两部分:候选人的背景信息和政治信息,因为我们的假设是候选人的政治观点应基于理性,且独立于出生地、母校等因素。我们进一步按时间顺序将该数据划分为4个阶段,以帮助理解候选人之间的极化是否及如何变化。该数据已清洗以去除偏差。为理解极化,我们首先展示 Word2Vec 和 Doc2Vec 中一些经典语言模型的结果,然后使用更强大的技术如 Longformer(一种基于 transformer 的编码器)来吸收更多信息,并基于政治观点和背景为每个候选人找到最近邻。
引用
@article{arxiv.2301.00891,
title = {Understanding Political Polarisation using Language Models: A dataset and method},
author = {Samiran Gode and Supreeth Bare and Bhiksha Raj and Hyungon Yoo},
journal= {arXiv preprint arXiv:2301.00891},
year = {2023}
}