通过知识图谱抽取解释语言模型
机器学习
2021-11-17 v1 计算与语言
摘要
在大规模文本语料上训练的基于 Transformer 的语言模型在自然语言处理领域广受欢迎,常作为下游任务的起点。尽管这些模型无疑十分有用,但超越传统准确率指标来量化其性能仍具挑战。本文中,我们通过训练过程中顺序阶段所获知识的快照来比较基于 BERT 的语言模型。通过以探测任务查询掩码语言模型,可揭示训练语料中的结构化关系。我们提出一种方法,通过在 RoBERTa 早期训练各阶段由完形填空“填空白”语句生成知识图谱抽取,来揭示知识获取时间线。我们将该分析扩展至预训练 BERT 变体(DistilBERT、BERT-base、RoBERTa)的比较。本工作提出一种通过知识图谱抽取(GED、Graph2Vec)比较语言模型的定量框架,并展示词性分析(POSOR)以识别各模型变体的语言学优势。利用这些指标,机器学习从业者可比较模型、诊断其行为优势与弱点,并识别新的针对性数据集以提升模型性能。
引用
@article{arxiv.2111.08546,
title = {Interpreting Language Models Through Knowledge Graph Extraction},
author = {Vinitra Swamy and Angelika Romanou and Martin Jaggi},
journal= {arXiv preprint arXiv:2111.08546},
year = {2021}
}
备注
Published at NeurIPS 2021: eXplainable AI for Debugging and Diagnosis Workshop