中文

忠实性与合理性:论大型语言模型解释的(不)可靠性

计算与语言 2024-03-15 v3

摘要

大型语言模型(LLM)被部署为多种自然语言处理(NLP)应用的强大工具。近期研究表明,现代 LLM 能够生成自我解释,通过引出其中间推理步骤来解释其行为。自我解释因其对话性和合理性而得到广泛采用。然而,对其忠实性几乎或完全没有了解。在本研究中,我们探讨了 LLM 生成的自我解释中忠实性与合理性之间的二元对立。我们认为,尽管 LLM 擅长生成合理的解释——对人类用户而言看似逻辑严密且连贯——但这些解释并不一定与 LLM 的推理过程相一致,引发了对其忠实性的担忧。我们强调,当前提高解释合理性的趋势(主要由对用户友好界面的需求所驱动)可能以牺牲其忠实性为代价。我们断言,在用于高风险决策的 LLM 中,解释的忠实性至关重要。此外,我们强调需要系统地表征不同现实世界应用的忠实性-合理性需求,并确保解释满足这些需求。虽然有多种方法可以提高合理性,但提高忠实性仍是一个开放挑战。我们呼吁社区开发新方法来增强自我解释的忠实性,从而实现在多样化高风险场景中 LLM 的透明部署。

关键词

引用

@article{arxiv.2402.04614,
  title  = {Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models},
  author = {Chirag Agarwal and Sree Harsha Tanneru and Himabindu Lakkaraju},
  journal= {arXiv preprint arXiv:2402.04614},
  year   = {2024}
}