EvalLM:基于用户自定义标准的大语言模型提示词交互式评估
人机交互
2024-02-28 v2 人工智能
计算与语言
摘要
通过简单地组合提示词,开发者可以利用大语言模型(LLMs)快速构建新颖的生成式应用原型。然而,要将原型精炼为产品,开发者必须通过对输出进行评估以诊断弱点,从而迭代地修订提示词。形成性访谈(N=8)显示,开发者在依据特定上下文且主观的标准手动评估输出时投入了大量精力。我们提出 EvalLM,一个通过基于用户自定义标准评估多个输出来迭代精炼提示词的交互式系统。通过以自然语言描述标准,用户可利用该系统基于 LLM 的评估器,概览提示词在何处表现出色或失败,并依据评估器的反馈加以改进。一项对比研究(N=12)表明,与手动评估相比,EvalLM 帮助参与者构建了更多样化的标准,检查了两倍数量的输出,并以少 59% 的修订次数达到满意的提示词。除提示词外,我们的工作可扩展至在特定应用情境中增强模型评估与对齐。
引用
@article{arxiv.2309.13633,
title = {EvalLM: Interactive Evaluation of Large Language Model Prompts on User-Defined Criteria},
author = {Tae Soo Kim and Yoonjoo Lee and Jamin Shin and Young-Ho Kim and Juho Kim},
journal= {arXiv preprint arXiv:2309.13633},
year = {2024}
}
备注
Accepted to CHI 2024