中文

谁在思考?借助 XAI 手册推动以人为中心的 LLM 评估

人机交互 2023-03-14 v1 人工智能

摘要

已部署的人工智能(AI)常对人类产生影响,且不存在适用于评估这些工具的通用指标。以人为中心的 AI 系统评估结合了定量与定性分析以及人类输入。在可解释 AI(XAI)与人机交互(HCI)领域已得到一定深度的探索。差距仍然存在,但人类与 AI 及其伴随解释进行交互,且人类的需求——连同其认知偏差与怪癖——应被置于核心位置,这一基本认识已被学界接受。本文中,我们 draw parallels between 相对成熟的 XAI 领域与围绕大语言模型(LLMs)快速发展的研究热潮。LLM 公认的评估指标并非以人为中心。我们认为,XAI 界过去十年走过的许多路径在讨论 LLM 时将被重走。具体而言,我们认为在评估已部署 LLM 时,人类的倾向——再次强调,连同其认知偏差与怪癖——应居于核心。我们概述了 XAI 以人为中心评估的三个已开发重点领域:心智模型、用例效用与认知参与,并强调探索这些概念对 LLM 的重要性。我们的目标是启动以人为中心的 LLM 评估。

关键词

引用

@article{arxiv.2303.06223,
  title  = {Who's Thinking? A Push for Human-Centered Evaluation of LLMs using the XAI Playbook},
  author = {Teresa Datta and John P. Dickerson},
  journal= {arXiv preprint arXiv:2303.06223},
  year   = {2023}
}

备注

Accepted to CHI 2023 workshop on Generative AI and HCI