中文

面向提示驱动自然语言解释的设计与评估分类学

计算与语言 2025-07-16 v1 人工智能

摘要

有效的AI治理需要结构化方法,使利益相关者能够访问和验证AI系统行为。随着大型语言模型的兴起,自然语言解释(Natural Language Explanations,NLEs)成为阐述模型行为的关键方式,这就需要聚焦其特征和治理影响。我们借鉴可解释AI(Explainable AI,XAI)文献,构建了针对提示驱动NLEs的更新型XAI分类学,涵盖三个维度:(1)情境因素,包括任务、数据、受众和目标;(2)生成与呈现,涵盖生成方法、输入、交互性、输出和形式;(3)评估,聚焦内容、呈现和以用户为中心的属性,以及评估场景。该分类学为研究人员、审计人员和政策制定者提供了框架,用于特征化、设计和提升面向透明AI系统的NLEs。

关键词

引用

@article{arxiv.2507.10585,
  title  = {A Taxonomy for Design and Evaluation of Prompt-Based Natural Language Explanations},
  author = {Isar Nejadgholi and Mona Omidyeganeh and Marc-Antoine Drouin and Jonathan Boisvert},
  journal= {arXiv preprint arXiv:2507.10585},
  year   = {2025}
}

备注

Presented at the Workshop of Technical AI Governance, 5 pages 2 figures