中文

移动端 MMLU:移动智能语言理解基准

计算与语言 2025-03-27 v1 人工智能

摘要

大语言模型(LLM)的快速发展增加了将其部署在移动设备上的兴趣,以实现移动端 AI 应用。移动用户与 LLM 的交互方式不同于桌面用户,形成独特的期望和数据偏差。当前基准数据集主要针对服务器和桌面环境,缺乏专为移动场景设计的大规模数据集。此外,移动设备面临存储和计算资源的严格限制,限制了模型规模和性能, necessitating 优化的效率和优先级知识。为此,我们引入 Mobile-MMLU—a 个针对移动智能的大规模基准数据集。它包含 80 个移动相关领域的 16,186 个问题,用于评估 LLM 在真实移动场景中的性能。一个具有挑战性的子集 Mobile-MMLU-Pro 提供类似 MMLU-Pro 的高级评估,但显著比标准全集更具挑战性。两个基准均使用多选题和顺序不变的问题,聚焦于实际移动交互场景,如食谱建议、旅行规划和日常必需品任务。数据集强调关键移动特定指标,如推理延迟、能耗、内存使用和响应质量,为在移动约束下评估模型性能提供全面见解。此外,它优先考虑隐私和适应性,评估模型在设备内处理、维护用户隐私和适应个人化使用模式方面的能力。Mobile-MMLU 系列为开发和比较移动优化 LLM 提供了标准框架,推动移动计算环境中生产力和决策能力的进步。我们的代码和数据可在:https://github.com/VILA-Lab/Mobile-MMLU 查看。

关键词

引用

@article{arxiv.2503.20786,
  title  = {Mobile-MMLU: A Mobile Intelligence Language Understanding Benchmark},
  author = {Sondos Mahmoud Bsharat and Mukul Ranjan and Aidar Myrzakhan and Jiacheng Liu and Bowei Guo and Shengkun Tang and Zhuang Liu and Yuanzhi Li and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2503.20786},
  year   = {2025}
}

备注

An order-invariant and mobile-centric benchmark. Code and data are available at: https://github.com/VILA-Lab/Mobile-MMLU