评估生态文本多标签分类中LLM提示符的数据增强
计算与语言
2025-03-04 v1 计算机与社会
社会与信息网络
摘要
大型语言模型(LLMs)在自然语言处理(NLP)任务中发挥着关键作用,提升了跨领域如翻译、摘要和文本分类等人类语言的理解、生成和操作能力。以往的研究表明,基于指令的LLMs可有效用于数据增强,以生成多样且逼真的文本样本。本研究针对俄语社交媒体中绿色实践的检测应用了基于提示的数据增强技术。检测社交媒体中的绿色实践有助于理解其流行程度,并有助于制定建议,以扩大生态友好行动的规模,以缓解环境问题。我们评估了用于多标签分类任务的多种提示符策略,包括通过LLM重写现有数据集、生成新数据或两者结合。我们的结果显示,所有策略都优于仅使用原始数据集微调的模型,在大多数情况下都表现出色。最佳结果来自于在明确指明相关类别的同时对原始文本进行改写的提示符。
引用
@article{arxiv.2411.14896,
title = {Evaluating LLM Prompts for Data Augmentation in Multi-label Classification of Ecological Texts},
author = {Anna Glazkova and Olga Zakharova},
journal= {arXiv preprint arXiv:2411.14896},
year = {2025}
}
备注
Ivannikov ISPRAS Open Conference (ISPRAS) 2024