中文

大语言模型无法自我解释

人机交互 2024-05-08 v1

摘要

大语言模型可以被提示生成文本,也可以被提示生成对其输出的"解释"。但这些并不是真正的解释,因为它们不准确地反映了预测背后的机械过程。这种它们反映推理过程的错觉可能会导致重大危害。这些"解释"当然有价值,但更多的是用于促进批判性思维,而非理解模型。我提出将这些"解释"重新置于语境中,使用"解释"一词来强调其外在性。我讨论了一些关于设计和技术的含义,例如在模型被提示生成解释时包含适当的警戒措施和响应。

关键词

引用

@article{arxiv.2405.04382,
  title  = {Large Language Models Cannot Explain Themselves},
  author = {Advait Sarkar},
  journal= {arXiv preprint arXiv:2405.04382},
  year   = {2024}
}

备注

In Proceedings of the ACM CHI 2024 Workshop on Human-Centered Explainable AI (HCXAI 2024)