中文

优化文本表示以刻画政党间(不)相似性

计算与语言 2022-10-24 v1

摘要

尽管微调神经语言模型在实现“深度”自动文本分析方面发挥了关键作用,但针对特定应用优化文本表示仍是一个关键瓶颈。在本研究中,我们在计算社会科学的一项任务背景下考察该问题,即建模政党间的成对相似性。我们的研究问题是,创建鲁棒文本表示需要何种程度的结构信息,将强信息标注方法(同时使用声明片段与声明类别标注)与放弃其中一种或两种标注、采用基于文档结构的启发式方法进行比较。我们在德国各政党 2021 年联邦选举的竞选纲领上评估模型。我们发现,最大化党内相对于党间相似性的启发式方法配合归一化步骤,可在无需人工标注的情况下实现可靠的政党相似性预测。

关键词

引用

@article{arxiv.2210.11989,
  title  = {Optimizing text representations to capture (dis)similarity between political parties},
  author = {Tanise Ceron and Nico Blokker and Sebastian Padó},
  journal= {arXiv preprint arXiv:2210.11989},
  year   = {2022}
}

备注

Conference on Computational Natural Language Learning 2022