中文

K-ON:将知识在大语言模型的头部层上堆叠

计算与语言 2025-02-11 v1 人工智能

摘要

近期大型语言模型 (LLM) 的快速发展显著提升了各种自然语言处理 (NLP) 任务的性能。通常情况下,LLM 被训练用于预测下一个 token,这与许多 NLP 任务的需求高度一致。然而,在知识图谱 (KG) 场景中,实体是基本单位,识别一个实体需要至少几个 token,这导致 KG 与自然语言之间的粒度不匹配。为解决此问题,我们提出了 K-ON,通过在下一个 k 步预测中采用多个头层来整合 KG 知识。K-ON 不仅可以在一步内生成实体级别的结果,还能对实体进行对比损失,这是 KG 表示学习中最有力的工具。实验结果表明,K-ON 在包含文本甚至其他模态的方法中取得了领先的性能。

关键词

引用

@article{arxiv.2502.06257,
  title  = {K-ON: Stacking Knowledge On the Head Layer of Large Language Model},
  author = {Lingbing Guo and Yichi Zhang and Zhongpu Bo and Zhuo Chen and Mengshu Sun and Zhiqiang Zhang and Wen Zhang and Huajun Chen},
  journal= {arXiv preprint arXiv:2502.06257},
  year   = {2025}
}

备注

AAAI 2025 (Oral)