中文

重新审视基于预训练序列到序列模型的关键短语生成的模型选择与解码

计算与语言 2023-10-24 v2

摘要

关键短语生成(KPG)是 NLP 中一项长期存在的任务,具有广泛应用。序列到序列(seq2seq)预训练语言模型(PLM)的出现为 KPG 带来了变革性时代,取得了令人鼓舞的性能提升。然而,许多设计决策仍未被探索且常随意制定。本文对模型选择与解码策略对基于 PLM 的 KPG 的影响进行系统分析。我们首先阐明 seq2seq PLM 为何适合 KPG,以注意力驱动假设为基础。接着我们确认,关于选择 seq2seq PLM 的传统认知缺乏深度:(1)仅增大模型规模或进行任务特定适配并不具备参数效率;(2)尽管将领域内的预训练与任务适配结合有益于 KPG,但其确实部分阻碍了泛化。关于解码,我们证明尽管贪心搜索取得强劲的 F1 分数,其在召回率上落后于基于采样的方法。基于这些见解,我们提出 DeSel,一种基于似然的解码-选择算法,用于 seq2seq PLM。DeSel 在五个数据集上将贪心搜索的语义 F1 平均提升 4.7%。我们的整体发现为未来更深入探究基于 PLM 的 KPG 铺平了道路。

关键词

引用

@article{arxiv.2310.06374,
  title  = {Rethinking Model Selection and Decoding for Keyphrase Generation with Pre-trained Sequence-to-Sequence Models},
  author = {Di Wu and Wasi Uddin Ahmad and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2310.06374},
  year   = {2023}
}

备注

EMNLP 2023 camera ready