ChroniclingAmericaQA:基于历史美国报纸页面构建的大规模问答数据集
计算与语言
2024-05-13 v2
摘要
问答 (QA) 和机器阅读理解 (MRC) 任务近年来由于深度学习技术的快速发展,尤其是近期的大型语言模型的出现而取得了显著进展。同时,许多基准数据集也变得可用。然而,大多数现有大规模基准数据集是使用同步文档集合(如维基百科或网络)创建的。档案文档集合,如历史报纸,包含仍未被广泛用于训练大型语言模型的过去有价值的信息。为进一步推动 QA 和 MRC 任务的发展,并克服以往数据集的局限性,我们介绍了 ChroniclingAmericaQA,这是一个基于历史报纸收藏 Chronicling America 创建的大规模时序 QA 数据集,包含 48.7 万问答对。该数据集由跨越 120 年的 Chronicling America 报纸收藏子集构建而成。利用数字化历史报纸收藏的一个重要挑战是 OCR 文本的质量较低。因此,为实现对 QA 模型的真实测试,本数据集可以三种不同方式使用:从原始噪声内容中回答问题、从更清洁、更正后的版本中回答问题,或从报纸页面的扫描图像中回答问题。这种独特性以及 ChroniclingAmericaQA 在可用 QA 数据集中跨越最长时间范围,使其成为一种独特且有用的资源。
引用
@article{arxiv.2403.17859,
title = {ChroniclingAmericaQA: A Large-scale Question Answering Dataset based on Historical American Newspaper Pages},
author = {Bhawna Piryani and Jamshid Mozafari and Adam Jatowt},
journal= {arXiv preprint arXiv:2403.17859},
year = {2024}
}
备注
Accepted at SIGIR 2024