HebID:以色列政治文本中社会身份检测的希伯来语多标签语料库
计算与语言
2026-02-24 v3
摘要
政治语言与社会身份密切相关。尽管社会身份常受特定文化背景影响并通过特定语言用法表达,但现有身份检测数据集主要以英语为中心,为单标签,聚焦粗糙的身份类别。我们引入HebID——首个用于社会身份检测的希伯来语多标签语料库:来自以色列政客2018年12月至2021年4月的Facebook帖子中5536个句子,依据调查数据人工标注12种细化社会身份(如右派、-ultra-orthodox、社会主义者)。我们对比了多标签和单标签编码器,以及2B-9B参数的生成式大语言模型,发现经希伯来语微调的大语言模型效果最佳(宏平均F1=0.74)。我们将分类器应用于政客的Facebook帖子和议会演讲,评估其在人气差异、时间趋势、聚类模式及性别相关身份表达上的表现。我们利用来自全国公众调查的身份选择,比较精英话语中呈现的身份与公众身份优先事项的差异。HebID为研究希伯来语社会身份提供了全面基础,亦可为其他非英语政治语境的类似研究提供范本。
引用
@article{arxiv.2508.15483,
title = {HebID: Detecting Social Identities in Hebrew-language Political Text},
author = {Guy Mor-Lan and Naama Rivlin-Angert and Yael R. Kaplan and Tamir Sheafer and Shaul R. Shenhav},
journal= {arXiv preprint arXiv:2508.15483},
year = {2026}
}
备注
EMNLP 2025 (Findings)