ICX360:面向上下文的解释工具包
计算与语言
2025-11-17 v1 机器学习
摘要
大语言模型(LLM)已在日常生活中变得无处不在,并正进入更高风险的应用领域,从会议记录概述到回答医生的问题。正如早期预测模型所示,至关重要的是我们需要开发工具来解释 LLM 的输出,无论是概述、列表、问题响应等。基于此,我们介绍了上下文解释 360(In-Context Explainability 360,ICX360),这是一个面向解释 LLM 的开源 Python 工具包,重点关注提供给 LLM 的用户上下文(或一般情况下的提示)。ICX360 包含针对三种最近工具的实现,这些工具分别使用黑箱和白箱方法(通过扰动和梯度)来解释 LLM。该工具包可在 https://github.com/IBM/ICX360 获取,包含快速入门指导材料以及详细的教程,涵盖检索增强生成、自然语言生成和越狱等用例。
引用
@article{arxiv.2511.10879,
title = {ICX360: In-Context eXplainability 360 Toolkit},
author = {Dennis Wei and Ronny Luss and Xiaomeng Hu and Lucas Monteiro Paes and Pin-Yu Chen and Karthikeyan Natesan Ramamurthy and Erik Miehling and Inge Vejsbjerg and Hendrik Strobelt},
journal= {arXiv preprint arXiv:2511.10879},
year = {2025}
}
备注
14 pages, 4 figures