理解从语言模型中提取事实知识的微调机制
计算与语言
2023-01-27 v1 机器学习
摘要
在来自网络的大规模文本语料上预训练的语言模型(LM)被观察到包含关于世界的各类大量知识。这一观察催生了知识图谱构建中一种新颖且令人振奋的范式:不再依赖人工整理或文本挖掘,而是从 LM 的参数中提取知识。近期研究表明,在一组事实知识上微调 LM 能使其对另一组查询给出更好的回答,从而使微调后的 LM 成为知识提取乃至知识图谱构建的良好候选。本文中,我们分析了用于事实知识提取的微调 LM。我们展示出,除其已知的积极作用外,微调还导致一种我们称之为频率冲击(Frequency Shock)的(可能有害的)现象:在测试时,模型过度预测训练集中出现的稀有实体,而欠预测未充分出现在训练集中的常见实体。我们表明频率冲击会导致模型预测性能下降,且超过某一临界点后,其危害甚至超过微调的积极作用,使微调整体上有害。随后我们考虑两种补救该负面效应的方案:1-模型混合;2-结合 LM 预训练任务的混合微调。这两种方案结合相较原始微调带来了显著改进。
引用
@article{arxiv.2301.11293,
title = {Understanding Finetuning for Factual Knowledge Extraction from Language Models},
author = {Mehran Kazemi and Sid Mittal and Deepak Ramachandran},
journal= {arXiv preprint arXiv:2301.11293},
year = {2023}
}