LLM 指导的半监督方法用于社交媒体危机数据分类
人工智能
2026-05-12 v1 计算与语言
摘要
半监督学习方法已被研究作为提升社交媒体数据分析的手段,尤其是在灾害管理情境下。在本工作中,我们对大语言模型(LLM)指导的半监督学习用于危机相关推文分类进行首次实证评估。我们比较了两种最新的 LLM 辅助半监督方法,VerifyMatch 和 LLM 指导的 Co-Training(LG-CoTrain),并将其与 established 半监督基线方法进行对比。我们的结果表明,LG-CoTrain 在资源有限的设置下(每类仅有 5、10 和 25 个标记示例)显著优于经典半监督方法,在各事件上实现最高的平均 Macro F1 分数。VerifyMatch 取得了具竞争力的性能,同时也展现出强大的校准特性。随着标记示例数量的增加,性能差距逐渐缩小,Self Training 也成为一个强大的基线方法。我们进一步观察到,紧凑型半监督模型在某些情况下可以超过在零样设置下运行的超大规模 LLM。这一发现突显了通过 LLM 指导的半监督学习将知识从 LLM 转移到更小且更可部署的模型的潜力,为实际的灾害响应应用提供了可行的路径。我们的项目仓库在 GitHub 上即是如此。
引用
@article{arxiv.2605.08448,
title = {LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification},
author = {Jacob Ativo and Bharaneeshwar Balasubramaniyam and Anh Tran and Khushboo Gupta and Hongmin Li and Doina Caragea and Cornelia Caragea},
journal= {arXiv preprint arXiv:2605.08448},
year = {2026}
}