中文

通过人类认知偏差捕捉大语言模型的失败模式

计算与语言 2022-11-28 v2 人工智能 机器学习

摘要

大语言模型生成复杂、开放式的输出:它们不是输出类别标签,而是撰写摘要、生成对话或产生可运行代码。为了评估这些开放式生成系统的可靠性,我们旨在识别错误行为的定性类别,而非仅仅识别个别错误。为了假设并检验此类定性错误,我们从人类认知偏差——偏离理性判断的系统性模式——中汲取灵感。具体而言,我们利用认知偏差作为动机来(i)生成模型可能存在问题的假设,以及(ii)设计引发这些问题的实验。以代码生成为案例研究,我们发现 OpenAI 的 Codex 会根据输入提示的框定方式可预测地出错,将输出向锚点调整,并偏向于模仿频繁训练样本的输出。随后我们使用我们的框架引发高影响的错误,例如错误地删除文件。我们的结果表明,来自认知科学的实验方法有助于刻画机器学习系统的行为方式。

关键词

引用

@article{arxiv.2202.12299,
  title  = {Capturing Failures of Large Language Models via Human Cognitive Biases},
  author = {Erik Jones and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2202.12299},
  year   = {2022}
}

备注

Published at NeurIPS 2022