中文

通过交互评估语言模型的数学能力

机器学习 2023-11-07 v2 人机交互

摘要

人们对于在构建问题求解助手时利用大语言模型(LLMs)的威力充满期待。然而,评估 LLMs 的标准方法依赖于静态的输入输出对,不足以就哪些 LLMs 以及在何种辅助设置下可被合理使用做出明智决策。静态评估未能考虑 LLM 部署中本质的交互元素,从而限制了对语言模型能力的理解。我们介绍 CheckMate,一个供人类与 LLMs 交互并评估的可适配原型平台。我们使用 CheckMate 开展了一项研究,评估三个语言模型(InstructGPT、ChatGPT 和 GPT-4)作为证明本科水平数学的助手,参与者为从本科生到数学教授构成的混合群体。我们发布了由此产生的交互与评分数据集 MathConverse。通过分析 MathConverse,我们推导出人类行为的分类法,并发现尽管存在总体正相关,但在 LLM 生成内容的正确性与感知有用性之间有显著背离实例,以及其他发现。进一步,我们通过一系列由数学专家贡献的案例研究,对 GPT-4 数学问题求解获得更细粒度的理解。我们以面向 ML 从业者和数学家的可操作要点作结:能够交流不确定性、对用户纠正响应良好、更具可解释性和简洁性的模型可能构成更好的助手。交互式评估是探究这些模型能力的有前景方式;人类应意识到语言模型的代数易错性,并辨别其适用场景。

关键词

引用

@article{arxiv.2306.01694,
  title  = {Evaluating Language Models for Mathematics through Interactions},
  author = {Katherine M. Collins and Albert Q. Jiang and Simon Frieder and Lionel Wong and Miri Zilka and Umang Bhatt and Thomas Lukasiewicz and Yuhuai Wu and Joshua B. Tenenbaum and William Hart and Timothy Gowers and Wenda Li and Adrian Weller and Mateja Jamnik},
  journal= {arXiv preprint arXiv:2306.01694},
  year   = {2023}
}