中文

检测俄语噪声社交媒体文本中的基本价值:多阶段分类框架

计算与语言 2026-03-20 v1

摘要

本研究提出一种用于检测俄语语言社交媒体中人类价值观的多阶段分类框架,在 750 万条公开文本帖子的随机样本上进行验证。基于舒瓦茨的基本人类价值理论,我们设计了一个包含垃圾信息和非个人内容过滤、针对价值相关和政治相关帖子的有针对性选择、LLM 标注以及多标签分类的多阶段管道。特别关注对 LLM 标注和模型预测质量的验证,并与人类专家进行比对。我们将人类专家标注不视为基准真实值,而是作为带有自身不确定性的解释性基准。为account for 标注主观性,我们将多个 LLM 生成的判断聚合为软标签,以反映不同程度的一致性。这些标签随后用于训练基于 Transformer 的模型,能够预测每个基本价值的概率。最佳-performing 模型 XLM RoBERTa large 在 held out test data 上实现了 0.83 的宏 F1 分数和 0.71 的 F1 分数。通过将价值检测视为一个多视角解释性任务,其中专家标签、GPT 标注和模型预测代表对同一文本的连贯但不完全相同的阅读,我们表明该模型通常与人类判断一致,但系统性地高估了 Openness to Change 价值领域。经验上,本研究揭示了俄语社交网络中价值表达及其共现模式,为更广泛的研究议程作出贡献,这些议程涉及文化差异、沟通框架以及基于价值的解释在数字环境中的应用。所有模型均公开发布。

关键词

引用

@article{arxiv.2603.18822,
  title  = {Detecting Basic Values in A Noisy Russian Social Media Text Data: A Multi-Stage Classification Framework},
  author = {Maria Milkova and Maksim Rudnev},
  journal= {arXiv preprint arXiv:2603.18822},
  year   = {2026}
}