模型能解释自身吗?自然语言解释的反事实可模拟性
计算与语言
2023-07-18 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)被训练来模仿人类以解释人类决策。然而,LLMs能解释自身吗?它们能帮助人类建立关于LLMs如何处理不同输入的心理模型吗?为回答这些问题,我们提出评估自然语言解释的(counterfactual simulatability):即一个解释能否使人类精确推断模型在所给输入的各种反事实版本上的输出。例如,若一个模型对输入问题“鹰能飞吗?”回答“能”,并给出解释“所有鸟都能飞”,那么人类会从该解释推断它也会对反事实输入“企鹅能飞吗?”回答“能”。若解释是精确的,则模型的回答应与人类预期一致。我们基于反事实可模拟性实现了两个指标:精确性(precision)与泛化性(generality)。我们使用LLMs自动生成多样的反事实。随后用这些指标在两项任务上评估了最先进的LLMs(如GPT-4):多跳事实推理与奖励建模。我们发现LLM的解释精确性较低,且精确性与可信度(plausibility)无关。因此,朴素地优化人类认可(如RLHF)可能并非充分的解决方案。
引用
@article{arxiv.2307.08678,
title = {Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations},
author = {Yanda Chen and Ruiqi Zhong and Narutatsu Ri and Chen Zhao and He He and Jacob Steinhardt and Zhou Yu and Kathleen McKeown},
journal= {arXiv preprint arXiv:2307.08678},
year = {2023}
}