中文

ICX360:面向上下文的解释工具包

计算与语言 2025-11-17 v1 机器学习

摘要

大语言模型(LLM)已在日常生活中变得无处不在,并正进入更高风险的应用领域,从会议记录概述到回答医生的问题。正如早期预测模型所示,至关重要的是我们需要开发工具来解释 LLM 的输出,无论是概述、列表、问题响应等。基于此,我们介绍了上下文解释 360(In-Context Explainability 360,ICX360),这是一个面向解释 LLM 的开源 Python 工具包,重点关注提供给 LLM 的用户上下文(或一般情况下的提示)。ICX360 包含针对三种最近工具的实现,这些工具分别使用黑箱和白箱方法(通过扰动和梯度)来解释 LLM。该工具包可在 https://github.com/IBM/ICX360 获取,包含快速入门指导材料以及详细的教程,涵盖检索增强生成、自然语言生成和越狱等用例。

关键词

引用

@article{arxiv.2511.10879,
  title  = {ICX360: In-Context eXplainability 360 Toolkit},
  author = {Dennis Wei and Ronny Luss and Xiaomeng Hu and Lucas Monteiro Paes and Pin-Yu Chen and Karthikeyan Natesan Ramamurthy and Erik Miehling and Inge Vejsbjerg and Hendrik Strobelt},
  journal= {arXiv preprint arXiv:2511.10879},
  year   = {2025}
}

备注

14 pages, 4 figures