词语重要性解释了提示词如何影响语言模型输出
人工智能
2024-03-06 v1 计算与语言
摘要
大型语言模型 (LLMs) 的出现彻底改变了各行各业的众多应用。然而,它们的“黑盒”性质往往阻碍了对其如何做出特定决策的理解,引发了对其透明度、可靠性和伦理使用的担忧。本研究提出了一种方法,通过改变提示词中的单个词语来揭示其对模型输出的统计影响,从而提高 LLMs 的可解释性。这种方法受表格数据排列重要性的启发,掩蔽系统提示中的每个词语,并根据聚合多个用户输入后的可用文本评分评估其影响。与经典的注意力机制不同,词语重要性衡量的是提示词对任意定义的文本评分的影响,这使得能够将词语的重要性分解为特定的关注指标——包括偏见、阅读水平、冗长度等。该过程还能够在无法获得注意力权重时衡量影响。为了测试这种方法的保真度,我们探讨了在多个不同的系统提示中添加不同后缀的效果,并比较了不同大型语言模型的后续生成结果。结果表明,对于多种评分函数,词语重要性评分与预期的后缀重要性密切相关。
引用
@article{arxiv.2403.03028,
title = {Word Importance Explains How Prompts Affect Language Model Outputs},
author = {Stefan Hackmann and Haniyeh Mahmoudian and Mark Steadman and Michael Schmidt},
journal= {arXiv preprint arXiv:2403.03028},
year = {2024}
}