FictionalQA:用于研究记忆与知识获取的数据集
计算与语言
2026-03-03 v2 机器学习
摘要
当语言模型在文本数据上训练时,它们会获取关于语言结构以及世界事实知识。推断时,其事实知识可用于解决有趣的问题并为用户执行有用的知识工作。众所周知,语言模型可以逐字记忆训练数据中长序列,但它们如何记忆训练中看到的事实却鲜有了解。本文提出一个新数据集,旨在帮助研究者研究事实记忆与逐字序列记忆的双重过程。该数据集由关于虚构事件的合成生成、类似网页文本的文档,以及关于这些事件的问答对组成。我们进行训练实验,表明关于虚构事件的合成数据对研究不同形式的记忆有用。我们也记录了构建真实、虚构合成数据的一些挑战。
引用
@article{arxiv.2506.05639,
title = {FictionalQA: A Dataset for Studying Memorization and Knowledge Acquisition},
author = {John Kirchenbauer and Janny Mongkolsupawan and Yuxin Wen and Tom Goldstein and Daphne Ippolito},
journal= {arXiv preprint arXiv:2506.05639},
year = {2026}
}
备注
10 pages and 8 figures in the main body. Published at ICLR 2026. Dataset is available at https://huggingface.co/datasets/jwkirchenbauer/fictionalqa, and code at https://github.com/jwkirchenbauer/fictionalqa