中文

LLMMaps——一种用于大语言模型分层评估的可视化隐喻

计算与语言 2023-10-13 v3 人工智能 图形学 机器学习

摘要

大语言模型(LLMs)已经彻底改变了自然语言处理,并在各种任务中展现出令人印象深刻的能力。遗憾的是,它们容易出现幻觉,即模型在响应中暴露不正确或虚假的信息,这使得严谨的评估方法成为必需。虽然 LLM 在特定知识领域的性能通常基于问答(Q&A)数据集进行评估,但此类评估通常仅报告数据集的单一准确率数值,而该数据集往往覆盖整个领域。这种基于领域的评估在透明度和模型改进方面存在问题。相比之下,分层评估可以揭示更可能发生幻觉的子领域,从而有助于更好地评估 LLM 的风险并指导其进一步发展。为支持此类分层评估,我们提出 LLMMaps 作为一种新颖的可视化技术,使用户能够针对 Q&A 数据集评估 LLM 的性能。LLMMaps 通过将 Q&A 数据集以及 LLM 响应转换为内部知识结构,提供对 LLM 在不同子领域中知识能力的详细洞察。用于比较可视化的扩展还允许对多个 LLM 进行详细比较。为评估 LLMMaps,我们使用它们对多个最先进的 LLM(如 BLOOM、GPT-2、GPT-3、ChatGPT 和 LLaMa-13B)以及两次定性用户评估进行了比较分析。用于生成 LLMMaps 的所有必要源代码和数据均可在 GitHub 上获取,以供科学出版物及其他用途使用:https://github.com/viscom-ulm/LLMMaps

关键词

引用

@article{arxiv.2304.00457,
  title  = {LLMMaps -- A Visual Metaphor for Stratified Evaluation of Large Language Models},
  author = {Patrik Puchert and Poonam Poonam and Christian van Onzenoodt and Timo Ropinski},
  journal= {arXiv preprint arXiv:2304.00457},
  year   = {2023}
}