中文

从连续提示的表示中引出文本描述

计算与语言 2024-10-16 v1

摘要

连续提示(或“软提示”)是大型语言模型中广泛采用的参数高效调优策略,但由于其不透明性质,往往不受青睐。先前的尝试通过将单个提示标记投影到词汇表空间来解释连续提示,但这种方法存在问题,因为高性能提示可能产生任意或相互矛盾的文本,并且将提示标记单独解释。在本工作中,我们提出了一种新的解释连续提示的方法,通过在模型推理期间从其表示中生成文本描述。我们对该方法在 various 任务上应用的 InSPEcT 变体(Ghandeharioun 等,2024),表明该方法通常会产生准确的任务描述,且随着任务性能的提升,描述的忠实度会增加。此外,一个完善版的 InSPEcT 揭示了连续提示中存在的偏见特征,其存在与模型预测中的偏见相关。作为一种有效的可解释性解决方案,InSPEcT 可用于调试连续提示中不受欢迎的属性,并为开发人员提供缓解方法。

关键词

引用

@article{arxiv.2410.11660,
  title  = {Eliciting Textual Descriptions from Representations of Continuous Prompts},
  author = {Dana Ramati and Daniela Gottesman and Mor Geva},
  journal= {arXiv preprint arXiv:2410.11660},
  year   = {2024}
}