StreamingQA:用于评估问答模型随时间适应新知识能力的基准
计算与语言
2022-05-24 v1 机器学习
摘要
通过问答(QA)评估的模型知识与语言理解通常在静态知识快照(如Wikipedia)上研究。然而,我们的世界是动态的、随时间演化,且我们模型的知识会变得过时。为研究半参数QA模型及其底层参数化语言模型(LMs)如何适应演化知识,我们构建了一个大规模新数据集StreamingQA,包含人为撰写及生成的在给定日期提出的问题,需从14年时间戳新闻文章中作答。我们在模型读取预训练未见过的新文章时按季度评估它们。我们展示参数化模型可在无需完全重训练的情况下更新,同时避免灾难性遗忘。对于半参数模型,将新文章加入搜索空间可实现快速适应,然而,底层LM过时的模型表现不如经重训练LM的模型。对于关于高频命名实体的问题,参数化更新尤其有益。在我们动态的世界中,StreamingQA数据集实现了对QA模型更现实的评估,且我们的实验凸显了若干有前景的未来研究方向。
引用
@article{arxiv.2205.11388,
title = {StreamingQA: A Benchmark for Adaptation to New Knowledge over Time in Question Answering Models},
author = {Adam Liška and Tomáš Kočiský and Elena Gribovskaya and Tayfun Terzi and Eren Sezener and Devang Agrawal and Cyprien de Masson d'Autume and Tim Scholtes and Manzil Zaheer and Susannah Young and Ellen Gilsenan-McMahon and Sophia Austin and Phil Blunsom and Angeliki Lazaridou},
journal= {arXiv preprint arXiv:2205.11388},
year = {2022}
}