使用公开社交媒体数据评估大型语言模型在健康相关文本分类任务中的表现
计算与语言
2024-03-29 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)在自然语言处理(NLP)任务中取得了显著成功。然而,目前缺乏评估其在基于社交媒体的健康相关自然语言处理任务上表现的研究,而这些任务传统上一直难以取得高分。我们在 6 个文本分类任务上对基于支持向量机(SVMs)的有监督经典机器学习模型、基于 RoBERTa、BERTweet 和 SocBERT 的三个有监督预训练语言模型(PLMs),以及两个基于 LLM 的分类器(GPT3.5 和 GPT4)进行了基准测试。我们开发了三种利用 LLM 进行文本分类的方法:将 LLM 作为零样本分类器;将 LLM 作为标注器为有监督分类器标注训练数据;以及利用带有少样本示例的 LLM 来增强手动标注数据。我们的综合实验表明,使用 LLM(GPT-4)进行数据增强,并以相对较少的人工标注数据来训练轻量级有监督分类模型,相比于仅使用人工标注数据进行训练,能取得更优的结果。有监督学习器在零样本设置下也优于 GPT-4 和 GPT-3.5。通过利用这种数据增强策略,我们可以发挥 LLM 的能力来开发更小、更有效的领域特定 NLP 模型。在没有人类指导的情况下使用 LLM 标注数据来训练轻量级有监督分类模型是一种无效的策略。然而,LLM 作为零样本分类器在排除假阴性方面显示出潜力,并有可能减少数据标注所需的人力。未来的研究必须探索最佳训练数据规模和最佳增强数据量。
引用
@article{arxiv.2403.19031,
title = {Evaluating Large Language Models for Health-Related Text Classification Tasks with Public Social Media Data},
author = {Yuting Guo and Anthony Ovadje and Mohammed Ali Al-Garadi and Abeed Sarker},
journal= {arXiv preprint arXiv:2403.19031},
year = {2024}
}