FANToM:用于交互中机器心理理论压力测试的基准
计算与语言
2023-11-01 v3 人工智能
摘要
心理理论(ToM)评估目前聚焦于使用本身缺乏交互性的被动叙事来测试模型。我们引入 FANToM,一个旨在通过问答在信息非对称对话语境中压力测试 ToM 的新基准。我们的基准借鉴了心理学的重要理论必要条件,以及在评估大语言模型(LLMs)时的必要经验考量。特别地,我们 formulate 多种类型的问题,其要求相同的底层推理,以识别 LLM 中虚幻或错误的 ToM 能力感。我们表明 FANToM 对最先进的 LLM 具有挑战性,即便使用思维链推理或微调,其表现也显著逊于人类。
引用
@article{arxiv.2310.15421,
title = {FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions},
author = {Hyunwoo Kim and Melanie Sclar and Xuhui Zhou and Ronan Le Bras and Gunhee Kim and Yejin Choi and Maarten Sap},
journal= {arXiv preprint arXiv:2310.15421},
year = {2023}
}
备注
EMNLP 2023. Code and dataset can be found here: https://hyunw.kim/fantom