大语言模型在理论心智任务微小改动下的失败
人工智能
2023-03-15 v5 计算与语言
摘要
直觉心理学是常识推理的支柱。在机器智能中复现此类推理是通向类人人工智能的重要里程碑。近期若干用于检验大语言模型(LLM)中该推理能力的任务与基准特别关注理论心智(ToM)任务中的信念归因。这些任务既有成功也有失败。我们尤其考察一个近期所谓的成功案例,并表明保持 ToM 原理的微小变动会使结果彻底反转。我们认为,总体而言,直觉心理学中模型评估的零假设应是怀疑性的,且离群失败案例应重于平均成功率。我们还考量了更强大的 LLM 未来在理论心智任务上可能取得的成功对于人类 ToM 任务意味着什么。
引用
@article{arxiv.2302.08399,
title = {Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks},
author = {Tomer Ullman},
journal= {arXiv preprint arXiv:2302.08399},
year = {2023}
}
备注
11 pages, 2 figures