探究LLM生成训练数据的成本效益:针对对话式语义帧分析
计算与语言
2024-10-10 v1 人工智能
摘要
近期研究表明,few-shot学习允许LLM以低成本生成监督模型的训练数据。然而,LLM生成的数据质量可能不完全匹配人工标注数据。这引发了一个关键问题:如何在更高质量但更昂贵的人工数据与更低质量但大幅 cheaper 的LLM生成数据之间进行权衡?本文使用GPT-4合成了对话式语义帧分析的训练数据,并检验了在不同预算下的最优分配策略。我们的实验在各种预算水平下均表明,跨越宽广预算范围,结合人工数据和LLM生成数据可实现最佳成本效益。值得注意的是,随着预算降低,更高比例的LLM生成数据变得更为可取。
引用
@article{arxiv.2410.06550,
title = {Investigating Cost-Efficiency of LLM-Generated Training Data for Conversational Semantic Frame Analysis},
author = {Shiho Matta and Yin Jou Huang and Fei Cheng and Hirokazu Kiyomaru and Yugo Murawaki},
journal= {arXiv preprint arXiv:2410.06550},
year = {2024}
}
备注
12 pages including 4 pages of references and appendix. 7 figures