中文

或许预训练语言模型该去上学——一项评估开卷与闭卷问答的任务

计算与语言 2026-05-25 v1 人工智能 机器学习

摘要

我们的目标是通过提供一项新任务与排行榜,以激发关于问答与预训练语言模型(PTLMs)的研究,使其理解重要的教学文档,例如大学入门教材或手册。PTLMs 在许多问答任务中经大量监督训练后表现出巨大成功,但在零样本设定下则逊色得多。我们提出一项新任务,包含社会科学(American Government 2e)与人文科学(U.S. History)的两本大学入门教材、基于教材作者所写复习题的数百条真/假陈述、基于教材前八章的验证/开发测试、基于其余章节的盲测,以及最先进 PTLMs 的基线结果。由于问题经过平衡,随机表现应约为 50%。用 BoolQ 微调的 T5 取得相同表现,表明教材内容并未在 PTLM 中预先表征。闭卷参加考试但已读过教材(即把教材加入 T5 的预训练)最多仅带来微小提升(56%),表明 PTLM 可能并未“理解”教材(或或许误解了问题)。开卷参加考试时(即允许机器自动检索一段文字并用其回答问题)表现更好(约 60%)。

关键词

引用

@article{arxiv.2110.01552,
  title  = {Perhaps PTLMs Should Go to School -- A Task to Assess Open Book and Closed Book QA},
  author = {Manuel R. Ciosici and Joe Cecil and Alex Hedges and Dong-Ho Lee and Marjorie Freedman and Ralph Weischedel},
  journal= {arXiv preprint arXiv:2110.01552},
  year   = {2026}
}

备注

Identical to the EMNLP 2021 version