中文

SmartBench:你的 LLM 真正是一个优秀的中文智能手机助手吗?

计算与语言 2025-08-27 v2 机器学习

摘要

大型语言模型已成为日常生活中不可或缺的一部分,尤其通过在智能手机上的端侧部署作为智能助手取得了进展。然而,现有的 LLM 评估基准主要关注英语的数学和编程等客观任务,这不一定能反映端侧 LLM 在现实移动场景中的实际用例,特别是对于中文用户。为了填补这些空白,我们引入了 SmartBench,这是第一个旨在评估中文移动场景下端侧 LLM 能力的基准。我们分析了代表性智能手机制造商提供的功能,并将其分为五类:文本摘要、文本问答、信息抽取、内容创作和通知管理,进一步细分为 20 项具体任务。对于每项任务,我们构建了包含 50 到 200 个反映日常移动交互的问答对的高质量数据集,并开发了为这些任务量身定制的自动化评估标准。我们使用 SmartBench 对端侧 LLM 和 MLLM 进行了全面评估,并评估了它们在真实智能手机 NPU 上量化部署后的性能。我们的贡献为评估中文端侧 LLM 提供了一个标准化框架,促进了这一关键领域的进一步发展和优化。代码和数据将在 https://github.com/vivo-ai-lab/SmartBench 上提供。

关键词

引用

@article{arxiv.2503.06029,
  title  = {SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?},
  author = {Xudong Lu and Haohao Gao and Renshou Wu and Shuai Ren and Xiaoxin Chen and Hongsheng Li and Fangyuan Li},
  journal= {arXiv preprint arXiv:2503.06029},
  year   = {2025}
}

备注

26 pages