中文

通过对比语言模型的注意力来增强知识学习中难以捕捉的线索

人工智能 2025-03-13 v2

摘要

因果语言模型在预训练期间会从通用文本语料库中获取大量知识,但知识学习的效率已知不令人满意,尤其是在从知识密集且小型语料库中学习时。这种缺陷可能源于长距离依赖问题,这些问题难以被语言模型捕捉,以及对训练文本中的共现模式和分散线索的过拟合。在解决这些问题方面,本文提出了一种方法,通过增强语言模型自身发现的难以捕捉但重要的线索来增强知识学习。我们发现,较大的语言模型更关注非显而易见但重要的线索,而这些线索往往被较小的语言模型忽略。因此,我们可以通过对比大型和小型语言模型的注意力权重来识别这些线索。我们将所识别的线索作为指导,对训练文本执行 token-dropout 数据增强,并观察到小型和大型模型在事实记忆方面性能显著提升。这表明,较强于较弱的语言模型之间的行为差异包含有关知识学习的重要线索,并且可以被一种直观的方式放大,以显著提高知识学习效率。

关键词

引用

@article{arxiv.2409.17954,
  title  = {Enhancing elusive clues in knowledge learning by contrasting attention of language models},
  author = {Jian Gao and Xiao Zhang and Ji Wu and Miao Li},
  journal= {arXiv preprint arXiv:2409.17954},
  year   = {2025}
}

备注

Oral presentation in AAAI 2025