中文

HebID:以色列政治文本中社会身份检测的希伯来语多标签语料库

计算与语言 2026-02-24 v3

摘要

政治语言与社会身份密切相关。尽管社会身份常受特定文化背景影响并通过特定语言用法表达,但现有身份检测数据集主要以英语为中心,为单标签,聚焦粗糙的身份类别。我们引入HebID——首个用于社会身份检测的希伯来语多标签语料库:来自以色列政客2018年12月至2021年4月的Facebook帖子中5536个句子,依据调查数据人工标注12种细化社会身份(如右派、-ultra-orthodox、社会主义者)。我们对比了多标签和单标签编码器,以及2B-9B参数的生成式大语言模型,发现经希伯来语微调的大语言模型效果最佳(宏平均F1=0.74)。我们将分类器应用于政客的Facebook帖子和议会演讲,评估其在人气差异、时间趋势、聚类模式及性别相关身份表达上的表现。我们利用来自全国公众调查的身份选择,比较精英话语中呈现的身份与公众身份优先事项的差异。HebID为研究希伯来语社会身份提供了全面基础,亦可为其他非英语政治语境的类似研究提供范本。

关键词

引用

@article{arxiv.2508.15483,
  title  = {HebID: Detecting Social Identities in Hebrew-language Political Text},
  author = {Guy Mor-Lan and Naama Rivlin-Angert and Yael R. Kaplan and Tamir Sheafer and Shaul R. Shenhav},
  journal= {arXiv preprint arXiv:2508.15483},
  year   = {2026}
}

备注

EMNLP 2025 (Findings)