中文

探究大语言模型在电商领域的应用

计算与语言 2024-08-26 v1 人工智能

摘要

大语言模型(LLM)的兴起在各类应用中革新了自然语言处理,尤其在电商领域。 在将此类LLM应用于这些领域之前,一个关键步骤是理解和比较其在不同用例中的性能。本文探讨了LLM在电商领域的有效性,具体 focus 于使用不同规模的公开电商数据集对开源LLM模型进行指令调优(instruction-tuning),并将其性能与工业应用中普遍使用的传统模型进行比较。我们对LLM与传统预训练语言模型在电商领域特定任务(即分类、生成、摘要和命名实体识别(NER))上的性能进行了全面比较。此外,我们检验了当前在电商特定任务中使用非常大LLM进行的 in-context learning 的有效性。我们的发现表明,few-shot推理的非常大LLM往往不优于对较小的预训练模型进行 fine-tuning,这凸显了任务特定模型优化的重要性。此外,我们还检查了不同的训练方法,如单任务训练、混合任务训练和LoRA合并,无论是在同一领域/任务内还是在不同任务之间。通过严格的实验与分析,本文为LLM在电商行业中提升自然语言处理能力提供了宝贵见解。

关键词

引用

@article{arxiv.2408.12779,
  title  = {Investigating LLM Applications in E-Commerce},
  author = {Chester Palen-Michel and Ruixiang Wang and Yipeng Zhang and David Yu and Canran Xu and Zhe Wu},
  journal= {arXiv preprint arXiv:2408.12779},
  year   = {2024}
}