不确定性决定序列到序列模型中模式的充分性与解码的可处理性
计算与语言
2022-04-04 v1
摘要
在许多自然语言处理(NLP)任务中,同一输入(如源句)可有多个可能输出(如译文)。为分析这种歧义(亦称内在不确定性)如何塑造神经序列模型所学分布,我们通过计算多参考测试集中参考间的重叠程度,来度量来自两个不同 NLP 任务——机器翻译(MT)与语法错误纠正(GEC)——的句子级不确定性。在句子级和任务级,内在不确定性对搜索的各个方面(如束搜索中的归纳偏置与精确搜索的复杂度)均有重大影响。具体而言,我们表明,束搜索错误数量多、模式不充分以及系统性能随束宽增大而下降等已知缺陷,适用于 MT 等高歧义任务,却不适用于 GEC 等不确定性较低的任务。此外,我们提出了一种用于神经序列模型的新型精确 -best 搜索算法,并表明内在不确定性会影响模型不确定性,因为模型倾向于对不确定任务和句子过度分散概率质量。
引用
@article{arxiv.2204.00471,
title = {Uncertainty Determines the Adequacy of the Mode and the Tractability of Decoding in Sequence-to-Sequence Models},
author = {Felix Stahlberg and Ilia Kulikov and Shankar Kumar},
journal= {arXiv preprint arXiv:2204.00471},
year = {2022}
}
备注
ACL 2022 paper