面向多语言和多模态电商应用的大语言模型可靠评估之路
人工智能
2025-10-24 v1
摘要
大语言模型(LLM)在通用 NLP 基准测试中表现出色,但其在特定领域的能力仍未得到充分探索。在电商领域,现有的评估方法——如 EcomInstruct、ChineseEcomQA、eCeLLM 和 Shopping MMLU——存在任务多样性有限(例如缺乏产品指导和售后问题)、任务模态有限(例如缺乏多模态数据)、数据来源为合成或精选数据,以及仅聚焦英语和中文的局限,使得实践者缺乏可靠的工具来评估模型在复杂现实购物场景中的表现。我们引入 EcomEval,这是一个用于评估大语言模型在电商领域的全方位多语言和多模态基准测试。EcomEval 涵盖六大类别、37项任务(包括8项多模态任务),主要来源于真实的客户查询和交易日志,反映了真实商业交互中噪声和异构性的特点。为确保参考答案的质量和可扩展性,我们采用半自动化流程,即由大模型草拟候选响应,随后由拥有强大的电商和多语言专业能力的50多名专家 annotators 审核和修改。我们通过对不同模型规模和能力的评估得分进行平均,定义每个问题和任务类别的难度级别,从而实现以挑战为导向和细粒度的评估。EcomEval 还覆盖七种语言,包括五种低资源东南亚语言,提供了此前工作中所缺乏的多语言视角。
引用
@article{arxiv.2510.20632,
title = {Towards Reliable Evaluation of Large Language Models for Multilingual and Multimodal E-Commerce Applications},
author = {Shuyi Xie and Ziqin Liew and Hailing Zhang and Haibo Zhang and Ling Hu and Zhiqiang Zhou and Shuman Liu and Anxiang Zeng},
journal= {arXiv preprint arXiv:2510.20632},
year = {2025}
}