中文

Shopping MMLU:面向大型语言模型的大规模多任务在线购物基准

机器学习 2024-11-01 v2 人工智能

摘要

在线购物是一个复杂的多任务、少样本学习问题,具有广泛且不断演变的实体、关系和任务。然而,现有的模型和基准通常针对特定任务定制,无法捕捉在线购物的全部复杂性。大型语言模型(LLM)凭借其多任务和少样本学习能力,有望通过减轻特定任务工程化工作以及为用户提供交互式对话来深刻变革在线购物。尽管具有潜力,但 LLM 在在线购物中面临独特的挑战,如领域特定概念、隐式知识和异构用户行为。受此潜力和挑战的启发,我们提出了 Shopping MMLU,这是一个源自真实世界 Amazon 数据的多样化多任务在线购物基准。Shopping MMLU 包含 57 项任务,涵盖 4 项主要购物技能:概念理解、知识推理、用户行为对齐和多语言性,从而能够全面评估 LLM 作为通用购物助手的能力。借助 Shopping MMLU,我们对 20 多个现有的 LLM 进行了基准测试,并揭示了关于构建基于 LLM 的多功能购物助手的实践和前景的宝贵见解。Shopping MMLU 可在 https://github.com/KL4805/ShoppingMMLU 公开访问。此外,借助 Shopping MMLU,我们在 KDD Cup 2024 中举办了一场竞赛,有超过 500 支参赛队伍参与。获胜的解决方案及相关研讨会可在我们的网站 https://amazon-kddcup24.github.io/ 上访问。

关键词

引用

@article{arxiv.2410.20745,
  title  = {Shopping MMLU: A Massive Multi-Task Online Shopping Benchmark for Large Language Models},
  author = {Yilun Jin and Zheng Li and Chenwei Zhang and Tianyu Cao and Yifan Gao and Pratik Jayarao and Mao Li and Xin Liu and Ritesh Sarkhel and Xianfeng Tang and Haodong Wang and Zhengyang Wang and Wenju Xu and Jingfeng Yang and Qingyu Yin and Xian Li and Priyanka Nigam and Yi Xu and Kai Chen and Qiang Yang and Meng Jiang and Bing Yin},
  journal= {arXiv preprint arXiv:2410.20745},
  year   = {2024}
}

备注

NeurIPS 2024 Datasets and Benchmarks Track Accepted. Modified typos in Figure 9