混合标注用于宣传检测:集成 LLM 预标注与人类智力
计算与语言
2025-07-25 v1
摘要
社交媒体上的宣传检测因任务复杂和缺乏高质量标注数据而具有挑战性。本文引入一种新框架,将人类专长与大语言模型 (LLM) 辅助相结合,以提高标注一致性和可扩展性。我们提出了一种分层主题系统,将 14 种细粒度宣传技巧组织为三个更广泛的类别,进行的人类标注研究揭示了细粒度标签的低标注者一致性问题,并实现了一种 LLM 辅助的预标注管道,从提取宣传性文本、生成简洁解释并分配局部标签和全局标签。第二次人类验证研究显示,在一致性和时间效率方面均实现了显著提升。基于此,我们微调较小的语言模型 (SLM) 来执行结构化标注。我们训练的是高质量 LLM 生成的数据,而非人类标注,允许大型模型产生这些标注,较小的模型通过知识蒸馏学习生成这些标注。我们的工作促进了可扩展且稳健的宣传检测系统的开发,支持与 SDG 16 相符合的透明和可 accountability 的媒体生态系统。代码已在我们的 GitHub 仓库中公开。
引用
@article{arxiv.2507.18343,
title = {Hybrid Annotation for Propaganda Detection: Integrating LLM Pre-Annotations with Human Intelligence},
author = {Ariana Sahitaj and Premtim Sahitaj and Veronika Solopova and Jiaao Li and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2507.18343},
year = {2025}
}
备注
NLP4PI at ACL