使用 Seq2Seq 模型与莱文斯坦距离对码混合数据中的音译词进行归一化
计算与语言
2018-05-23 v1
摘要
随着码混合数据在社交媒体上呈指数级增长,构建面向码混合数据的工具在自然语言处理(NLP)研究界正迅速受到关注。处理码混合数据存在若干挑战,尤其是除社交媒体场景所有已知挑战外,还存在语法不一致与拼写变体问题。在本文中,我们提出一种新颖架构,专注于归一化码混合数据中常见的语音打字变体。我们架构的主要特性之一是,除归一化外,在某些情况下也可用于反向音译与词识别。我们的模型在测试数据上达到了 90.27% 的准确率。
引用
@article{arxiv.1805.08701,
title = {Normalization of Transliterated Words in Code-Mixed Data Using Seq2Seq Model & Levenshtein Distance},
author = {Soumil Mandal and Karthick Nanmaran},
journal= {arXiv preprint arXiv:1805.08701},
year = {2018}
}
备注
5 pages, 1 figure, 2 tables