将自监督词元嵌入应用于表格
信息检索
2017-10-26 v2 计算与语言
摘要
通过电子信息分发信息是许多企业和个人的主要传输手段,通常以纯文本表格的形式存在。随着其数量的增长,使用算法而非人工来提取文本和数字变得必要。现有方法通常侧重于正则表达式或数据中的严格结构,但在存在大量变体、模糊结构或隐式标签时效率低下。本文引入了 SC2T,一种完全自监督的模型,通过利用字符和上下文层级来解决这些问题,为半结构化信息中的词元构建向量表示。随后,该模型可用于词元的无监督标注,或作为半监督信息抽取系统的基础。
引用
@article{arxiv.1708.04120,
title = {Putting Self-Supervised Token Embedding on the Tables},
author = {Marc Szafraniec and Gautier Marti and Philippe Donnat},
journal= {arXiv preprint arXiv:1708.04120},
year = {2017}
}