利用大语言模型与弱监督进行社交媒体数据标注:基于COVID-19自报疫苗接种推文的评估
计算与语言
2023-09-14 v1 机器学习
社会与信息网络
摘要
COVID-19大流行给医疗行业乃至整个社会带来了重大挑战。随着COVID-19疫苗的快速发展,社交媒体平台已成为疫苗相关话题讨论的流行媒介。识别并分析疫苗相关推文可为公共卫生研究人员和决策者提供宝贵见解。然而,人工标注大量推文耗时且昂贵。在本研究中,我们评估了大语言模型(本例中为GPT-4(3月23日版本))与弱监督用于识别COVID-19疫苗相关推文的效用,旨在与人工标注者进行性能比较。我们利用人工整理的黄金标准数据集,并使用GPT-4以单样本模式(无额外提示)提供标签,未进行任何额外微调或指令。
引用
@article{arxiv.2309.06503,
title = {Leveraging Large Language Models and Weak Supervision for Social Media data annotation: an evaluation using COVID-19 self-reported vaccination tweets},
author = {Ramya Tekumalla and Juan M. Banda},
journal= {arXiv preprint arXiv:2309.06503},
year = {2023}
}