E-Bench:评估大型语言模型易用性
计算与语言
2024-06-18 v1
摘要
大多数大型语言模型(LLM)对提示词敏感,甚至 slightest 的同义表达或拼写错误都可能导致模型产生意外结果。针对特定需求构写最优提示词缺乏理论支持,完全依赖人类实验,这构成了生成式人工智能普及的重要障碍。然而,现有研究缺乏对 LLM 在抵御提示扰动稳定性的系统性分析。本文提出评估 LLM 易用性的方案,构建 E-Bench,通过模拟人类实际使用情境中的同义扰动(包括改写、简化和口语化)和拼写扰动(如输入错误)来进行评估。基于此,我们讨论了这两种扰动的组合,并分析性能下降的主要原因。实验结果表明,随着模型规模的增加,虽然易用性显著提升,但仍需迈过许多障碍才能构建足够用户友好的模型。
引用
@article{arxiv.2406.10950,
title = {E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models},
author = {Zhenyu Zhang and Bingguang Hao and Jinpeng Li and Zekai Zhang and Dongyan Zhao},
journal= {arXiv preprint arXiv:2406.10950},
year = {2024}
}