中文

双向语言模型是否更擅长记忆知识?面向真实世界知识注入的基准测试

计算与语言 2025-05-20 v1

摘要

尽管大型语言模型(LLM)在知识记忆能力方面取得了显著进展,但由于缺乏标准化且高质量的测试基准,其知识记忆能力仍未得到充分探索。本文引入了一套新颖的、源自真实世界且规模庞大的知识注入基准测试,该基准能够随时间演化且无需人工干预。具体而言,我们提出了 WikiDYK,利用来自维基百科“Did You Know...”条目中近期新增且经专家编辑挑选、基于可验证性和清晰性等标准筛选的事实。这些条目被转换为多种任务格式的问答对,从易到的复杂多跳问题不等。WikiDYK 包含 12,290 条事实和 77,180 个问题,并且能够无缝扩展至维基百科编辑器未来的更新。通过持续预训练进行的大量实验揭示了一个令人惊讶的发现:尽管双向语言模型(BiLM)在现代 LLM 中占据主导地位,但因果语言模型(CLM)在知识记忆能力方面表现显著优于双向语言模型,准确率低于 23%。为弥补当前 BiLM 规模较小的不足,我们引入了一种模块化协作框架,利用 BiLM 的集合作为外部知识库与 LLM 集成。实验表明,我们的框架在可靠性准确率上提升了最高可达 29.1%。

关键词

引用

@article{arxiv.2505.12306,
  title  = {Bidirectional LMs are Better Knowledge Memorizers? A Benchmark for Real-world Knowledge Injection},
  author = {Yuwei Zhang and Wenhao Yu and Shangbin Feng and Yifan Zhu and Letian Peng and Jayanth Srinivasa and Gaowen Liu and Jingbo Shang},
  journal= {arXiv preprint arXiv:2505.12306},
  year   = {2025}
}

备注

Dataset is available at https://huggingface.co/datasets/YWZBrandon/wikidyk