中文

若集束搜索是答案,那问题是什么?

计算与语言 2021-01-19 v2

摘要

颇令人惊讶的是,神经语言生成器的精确最大后验(MAP)解码常导致低质量结果。相反,尽管集束搜索的搜索错误率极高,大多数语言生成任务的最先进结果仍由其取得。这意味着 MAP 目标本身并未表达我们所期望的文本性质,由此引出问题:若集束搜索是答案,那问题是什么?我们将集束搜索框定为另一解码目标的精确解,以洞察为何模型下的高概率本身未必表示充分性。我们发现集束搜索在文本中强制均匀信息密度,这一性质受认知科学启发。我们提出一组显式强制该性质的解码目标,并发现使用这些目标的精确解码缓解了解码校准不良的语言生成模型时遇到的问题。此外,我们分析了使用不同解码策略生成的文本,并看到在神经机器翻译实验中,该性质被遵循的程度与 BLEU 强相关。

关键词

引用

@article{arxiv.2010.02650,
  title  = {If beam search is the answer, what was the question?},
  author = {Clara Meister and Tim Vieira and Ryan Cotterell},
  journal= {arXiv preprint arXiv:2010.02650},
  year   = {2021}
}

备注

EMNLP 2020