呼吁厘清束搜索:其运作机制与失效情形
计算与语言
2024-02-29 v3
摘要
基于束搜索的文本生成已在广泛应用场景中证明成功。我们指出,尽管文献中普遍忽视,常用的束解码实现(如Hugging Face Transformers与fairseq)采用了先到先服务的启发式策略:它在时间步上保留一组已完成的序列,并在该集合大小达到束宽时停止。基于该发现,我们引入耐心因子(patience factor),一种对该束解码实现的简单修改,它推广了停止准则并为搜索深度提供了灵活性。实证结果表明,调整该耐心因子在新闻文本摘要与跨多种语言对的机器翻译上提升了强预训练模型的解码性能,且推理减速可忽略。我们的方法仅修改一行代码,因此可轻易集成于任何实现中。进一步,我们发现不同版本的束解码在摘要任务上导致巨大性能差异,表明研究工作中有必要明确指定束搜索的实现。我们的代码将在发表后公开。
引用
@article{arxiv.2204.05424,
title = {A Call for Clarity in Beam Search: How It Works and When It Stops},
author = {Jungo Kasai and Keisuke Sakaguchi and Ronan Le Bras and Dragomir Radev and Yejin Choi and Noah A. Smith},
journal= {arXiv preprint arXiv:2204.05424},
year = {2024}
}
备注
LREC-COLING 2024