中文

用于可解释大语言模型的三元融合框架:认知、功能与因果维度——TAXAL框架

计算与语言 2025-09-08 v1

摘要

大语言模型(LLM)越来越多地被部署在高风险领域,其中不透明性、偏见和不稳定性削弱了信任和问责。传统可解释性方法聚焦于表面输出,无法捕捉代理型LLM的推理路径、规划逻辑和系统性影响。我们提出了TAXAL(代理型LLM可解释性的三元对齐,Triadic Alignment for eXplainability in Agentic LLMs),一个三元融合框架,整合了三个互补维度:认知(用户理解)、功能(实用效用)和因果(忠实推理)。TAXAL为在多样化的社会技术环境中设计、评估和部署解释提供了统一的、角色敏感的框架。我们的分析综合了现有方法,从后验归因和对话式界面到面向解释提示,并将其置于TAXAL三元融合模型中。我们进一步通过法律、教育、医疗和公共服务领域的案例研究展示了其适用性,说明了解释策略如何适应制度约束和利益相关者角色。通过将概念清晰性与设计模式和部署路径相结合,TAXAL将可解释性推进为一项技术和社技实践,支持代理型AI时代的可信和上下文敏感的大语言模型应用。

关键词

引用

@article{arxiv.2509.05199,
  title  = {Triadic Fusion of Cognitive, Functional, and Causal Dimensions for Explainable LLMs: The TAXAL Framework},
  author = {David Herrera-Poyatos and Carlos Peláez-González and Cristina Zuheros and Virilo Tejedor and Rosana Montes and Francisco Herrera},
  journal= {arXiv preprint arXiv:2509.05199},
  year   = {2025}
}

备注

27 pages, 9 tables and 2 figures