大语言模型能否助力预训练语言模型的可解释性分析?
计算与语言
2023-10-23 v2
摘要
为揭示预训练语言模型中编码的知识,现有工作依赖于标注语料库或人在回路方法。然而,这些方法在可扩展性和解释范围上受到限制。我们提出使用大语言模型(LLM)ChatGPT 作为标注器,以实现对预训练语言模型的细粒度解释分析。我们通过对上下文化表示应用凝聚式层次聚类,发现预训练语言模型中的潜在概念,随后使用 ChatGPT 对这些概念进行标注。我们的结果表明,与人工标注概念相比,ChatGPT 生成的标注更准确且语义更丰富。此外,我们展示了基于 GPT 的标注如何赋能解释分析方法,并演示了其中两种:探针框架与神经元解释。为促进该领域的进一步探索与实验,我们发布了一个包含 39,000 个标注概念的庞大 ConceptNet 数据集(TCN)。
引用
@article{arxiv.2305.13386,
title = {Can LLMs facilitate interpretation of pre-trained language models?},
author = {Basel Mousi and Nadir Durrani and Fahim Dalvi},
journal= {arXiv preprint arXiv:2305.13386},
year = {2023}
}
备注
EMNLP 2023