中文

将自监督词元嵌入应用于表格

信息检索 2017-10-26 v2 计算与语言

摘要

通过电子信息分发信息是许多企业和个人的主要传输手段,通常以纯文本表格的形式存在。随着其数量的增长,使用算法而非人工来提取文本和数字变得必要。现有方法通常侧重于正则表达式或数据中的严格结构,但在存在大量变体、模糊结构或隐式标签时效率低下。本文引入了 SC2T,一种完全自监督的模型,通过利用字符和上下文层级来解决这些问题,为半结构化信息中的词元构建向量表示。随后,该模型可用于词元的无监督标注,或作为半监督信息抽取系统的基础。

关键词

引用

@article{arxiv.1708.04120,
  title  = {Putting Self-Supervised Token Embedding on the Tables},
  author = {Marc Szafraniec and Gautier Marti and Philippe Donnat},
  journal= {arXiv preprint arXiv:1708.04120},
  year   = {2017}
}