利用子词嵌入进行多国地址解析
计算与语言
2022-04-12 v3 机器学习
摘要
地址解析包括识别构成地址的各部分,如街道名或邮政编码。由于其在记录链接等任务中的重要性,地址解析已通过多种技术进行研究。神经网络方法确立了地址解析的新 state-of-the-art。尽管该方法取得了显著结果,先前工作仅聚焦于应用神经网络实现单一来源国家地址的解析。我们提出一种方法,采用子词嵌入与循环神经网络架构来构建单一模型,能够同时学习解析来自多个国家的地址,同时考虑语言与地址格式系统的差异。我们在用于训练的国家上达到了约 99% 的准确率,无需任何预处理或后处理。我们探索了将在部分国家地址上训练获得的地址解析知识迁移至其他国家、且在零样本迁移学习设定下无需进一步训练的可能性。我们对 80% 的国家(41 个中的 33 个)取得了良好结果,其中近 50%(41 个中的 20 个)接近 state-of-the-art 性能。此外,我们提出了训练模型的开源 Python 实现。
引用
@article{arxiv.2006.16152,
title = {Leveraging Subword Embeddings for Multinational Address Parsing},
author = {Marouane Yassine and David Beauchemin and François Laviolette and Luc Lamontagne},
journal= {arXiv preprint arXiv:2006.16152},
year = {2022}
}
备注
Accepted to IEEE CiSt'20