中文

使用神经序列到序列模型的化合物名称标准化

计算与语言 2019-01-23 v1

摘要

化学信息抽取是将文本中的化学知识转换为真实化学数据库,这是一项严重依赖化合物名称识别与标准化的文本处理任务。一旦给出化合物的系统名称,就能自然且非常简单地将该名称转换为最终所需的分子式。然而,对于许多化学物质,除系统名称外它们还以许多其他名称出现,这给该任务带来了巨大挑战。在本文中,我们提出一个框架,通过使用拼写错误纠正、字节对编码分词和神经序列到序列模型,从非系统名称自动标准化为相应的系统名称。我们的框架端到端训练且完全数据驱动。我们在测试数据集上的标准化准确率达到 54.04%,与先前最先进结果相比有显著提升。

关键词

引用

@article{arxiv.1901.07003,
  title  = {Chemical Names Standardization using Neural Sequence to Sequence Model},
  author = {Junlang Zhan and Hai Zhao},
  journal= {arXiv preprint arXiv:1901.07003},
  year   = {2019}
}