LLM Comparator:用于大型语言模型并排评估的可视化分析
人机交互
2024-02-19 v1 人工智能
计算与语言
机器学习
摘要
自动并排评估已成为评估大型语言模型(LLMs)响应质量的一种有前景的方法。然而,分析这种评估方法的结果带来了可扩展性和可解释性方面的挑战。在本文中,我们提出了 LLM Comparator,这是一种新颖的可视化分析工具,用于交互式地分析自动并排评估的结果。该工具支持交互式工作流,帮助用户理解模型在何时以及为何表现得比基线模型更好或更差,以及两个模型的响应在定性上有何不同。通过与一家大型科技公司的研究人员和工程师密切合作,我们迭代地设计并开发了该工具。本文详细介绍了我们识别出的用户挑战、该工具的设计与开发,以及一项由定期评估其模型的参与者参与的观察性研究。
引用
@article{arxiv.2402.10524,
title = {LLM Comparator: Visual Analytics for Side-by-Side Evaluation of Large Language Models},
author = {Minsuk Kahng and Ian Tenney and Mahima Pushkarna and Michael Xieyang Liu and James Wexler and Emily Reif and Krystal Kallarackal and Minsuk Chang and Michael Terry and Lucas Dixon},
journal= {arXiv preprint arXiv:2402.10524},
year = {2024}
}