使用 LLM 生成标签预测产品评论的使用选项
计算与语言
2024-10-17 v1
摘要
标注大型数据集具有挑战性。然而,众包方法往往成本高昂且在处理非平凡任务时可能质量不达标。我们提出了一种使用大语言模型作为 few-shot 学习器进行数据标注的方法,用于预测来自客户评论的产品使用选项。我们还提出了一种新的评估指标 HAMS4,可用于与多个参考集合进行字符串比较。学习自定义模型相对于直接为序列到序列任务使用 LLM 提供了个体控制能源效率和隐私保护的能力。我们将此数据标注方法与其他传统方法进行比较,展示了大语言模型可实现显著的成本节省。我们发现,生成数据的质量超过了第三方供应商服务的水平,甚至 GPT-4 生成的标签达到了领域专家的水平。我们公开了代码和生成的标签。
引用
@article{arxiv.2410.12470,
title = {Learning to Predict Usage Options of Product Reviews with LLM-Generated Labels},
author = {Leo Kohlenberg and Leonard Horns and Frederic Sadrieh and Nils Kiele and Matthis Clausen and Konstantin Ketterer and Avetis Navasardyan and Tamara Czinczoll and Gerard de Melo and Ralf Herbrich},
journal= {arXiv preprint arXiv:2410.12470},
year = {2024}
}
备注
9 pages