基于多语言 Transformer 的序列到序列词汇规范化
计算与语言
2021-10-13 v3
摘要
当前自然语言处理的基准任务所包含的文本,在性质上不同于日常非正式数字通信中使用的文本。这种差异导致最先进的 NLP 模型在真实世界数据上微调时性能严重下降。解决此问题的一种方法是通过词汇规范化,即将非标准文本(通常来自社交媒体)转换为更标准化的形式。在这项工作中,我们提出一种基于 mBART 的句子级序列到序列模型,将问题框定为机器翻译问题。由于噪声文本是跨语言普遍存在的问题,不仅限于英语,我们利用 mBART 的多语言预训练将其微调到我们的数据上。虽然当前方法主要在词或子词级别操作,我们认为该方法从技术角度看直接明了,并建立在已有的预训练 transformer 网络之上。我们的结果表明,尽管在词级内在性能评估上落后于其他方法,但相较于在原始未处理的社交媒体文本上运行的模型,我们的模型通过规范化在外在下游任务上提升了性能。
引用
@article{arxiv.2110.02869,
title = {Sequence-to-Sequence Lexical Normalization with Multilingual Transformers},
author = {Ana-Maria Bucur and Adrian Cosma and Liviu P. Dinu},
journal= {arXiv preprint arXiv:2110.02869},
year = {2021}
}
备注
In Proceedings of the 7th Workshop on Noisy User-generated Text (WNUT 2021), EMNLP 2021