中文

贪心解码在抽取式问答中的最优性如何?

计算与语言 2022-11-09 v2

摘要

微调后的语言模型利用贪心解码以相对成功的效果回答阅读理解问题。然而,该方法既不能确保答案是给定段落中的一个片段,也不能保证其是最可能的一个。贪心解码的实际表现是否真的劣于遵循这些性质的算法?为研究贪心解码的性能与最优性,我们提出 exact-extract,一种能在上下文中高效找到最可能答案片段的解码算法。我们在零样本与少样本抽取式问答上比较了 T5 与两种解码算法的性能。当无可用训练样本时,exact-extract 显著优于贪心解码。然而,随着少量训练样本的引入,贪心解码迅速收敛至 exact-extract 的性能,随着训练集增大变得更具抽取性,并越来越可能生成最可能片段。我们还表明,自监督训练可使模型偏向抽取行为,从而在零样本设定下无需标注样本即可提升性能。总体而言,我们的结果表明,预训练语言模型极其擅长适应抽取式问答,通常只需在小训练集上微调,贪心算法便足以模拟最优解码策略。

关键词

引用

@article{arxiv.2108.05857,
  title  = {How Optimal is Greedy Decoding for Extractive Question Answering?},
  author = {Or Castel and Ori Ram and Avia Efrat and Omer Levy},
  journal= {arXiv preprint arXiv:2108.05857},
  year   = {2022}
}

备注

AKBC 2022 12 pages, 3 figures