中文

伪对数似然在自然语言评分中的应用

计算与语言 2022-01-25 v1 人工智能 机器学习

摘要

利用大规模自然语言语料进行半监督机器学习所构建的语言模型,已迅速席卷自然语言生成与理解领域。本文采用一种零样本方法,该方法由多位研究者独立提出,现正作为微调之外的重要替代方案在常识任务评测中获得认可。相较于更新的语言模型(T5),参数与训练步数均较少的模型能在近期大型数据集(TimeDial)上超越前者,同时在同类语言任务中表现出鲁棒性。令人惊讶的是,这一结果是通过在较小模型上使用无超参数的零样本方法取得的,而较大模型则采用了微调。我们认为,较小模型的鲁棒性应从组合性角度理解,其含义取自近期关于一类相似模型的文献。我们指出了该方法与模型的一个实际代价:自然语言评测的高GPU耗时。这种零样本度量技术对ALBERT及其他BERT变体均产生显著的稳定性,它是将伪对数似然应用于掩码语言模型,以在Winograd Schema Challenge、Winogrande等强制选择语言任务中对替换候选项的概率进行相对度量。本文的一个贡献是将若干相似但独立的研究脉络汇聚起来。我们在二选一常识推理任务上取得了一些绝对的SOTA结果,优于文献中任何已发表的结果,包括微调方法。我们展示了该模型在对抗设定下性能的显著一致性,我们认为这最好由模型表示的组合性来解释。

关键词

引用

@article{arxiv.2201.09377,
  title  = {An Application of Pseudo-Log-Likelihoods to Natural Language Scoring},
  author = {Darren Abramson and Ali Emami},
  journal= {arXiv preprint arXiv:2201.09377},
  year   = {2022}
}