中文

大语言模型能否助力预训练语言模型的可解释性分析?

计算与语言 2023-10-23 v2

摘要

为揭示预训练语言模型中编码的知识,现有工作依赖于标注语料库或人在回路方法。然而,这些方法在可扩展性和解释范围上受到限制。我们提出使用大语言模型(LLM)ChatGPT 作为标注器,以实现对预训练语言模型的细粒度解释分析。我们通过对上下文化表示应用凝聚式层次聚类,发现预训练语言模型中的潜在概念,随后使用 ChatGPT 对这些概念进行标注。我们的结果表明,与人工标注概念相比,ChatGPT 生成的标注更准确且语义更丰富。此外,我们展示了基于 GPT 的标注如何赋能解释分析方法,并演示了其中两种:探针框架与神经元解释。为促进该领域的进一步探索与实验,我们发布了一个包含 39,000 个标注概念的庞大 ConceptNet 数据集(TCN)。

关键词

引用

@article{arxiv.2305.13386,
  title  = {Can LLMs facilitate interpretation of pre-trained language models?},
  author = {Basel Mousi and Nadir Durrani and Fahim Dalvi},
  journal= {arXiv preprint arXiv:2305.13386},
  year   = {2023}
}

备注

EMNLP 2023