面向字符级转写的硬非单调注意力
计算与语言
2024-02-21 v3
摘要
字符级字符串到字符串转写是各种 NLP 任务的重要组件。目标是将输入字符串映射到输出字符串,其中字符串长度可能不同且字符取自不同字母表。近期方法已使用带注意力机制的序列到序列模型来学习在生成输出字符串期间模型应关注输入字符串的哪些部分。软注意力和硬单调注意力均已被使用,但硬非单调注意力仅用于其他序列建模任务如图像描述(Xu et al., 2015),且需要随机近似来计算梯度。在本工作中,我们引入一种精确的多项式时间算法,用于对两个字符串之间指数数量的不可单调对齐进行边际化,表明硬注意力模型可被视为经典 IBM Model 1 的神经重参数化。我们在实验上比较软和硬非单调注意力,发现精确算法相较随机近似显著改善性能,并优于软注意力。代码见 https://github.com/shijie-wu/neural-transducer。
引用
@article{arxiv.1808.10024,
title = {Hard Non-Monotonic Attention for Character-Level Transduction},
author = {Shijie Wu and Pamela Shapiro and Ryan Cotterell},
journal= {arXiv preprint arXiv:1808.10024},
year = {2024}
}
备注
Published in EMNLP 2018