用于关系抽取的近无监督哈希码表示
机器学习
2019-09-10 v1 人工智能
计算与语言
信息论
math.IT
机器学习
摘要
近来,核化局部敏感哈希码已成功用作自然语言文本的表示,尤其在与生物医学关系抽取任务高度相关的场景中。本文中,我们提出以近无监督方式优化哈希码表示,其中仅使用数据点而非其类别标签进行学习。优化后的哈希码表示随后按先前工作送入监督分类器。这种近无监督方法允许对每个哈希函数进行细粒度优化,特别适用于构建从训练集泛化到测试集的哈希码表示。我们在生物医学关系抽取任务上对所提方法进行了实证评估,相较最先进的监督与半监督方法取得了显著的准确率提升。
引用
@article{arxiv.1909.03881,
title = {Nearly-Unsupervised Hashcode Representations for Relation Extraction},
author = {Sahil Garg and Aram Galstyan and Greg Ver Steeg and Guillermo Cecchi},
journal= {arXiv preprint arXiv:1909.03881},
year = {2019}
}
备注
Proceedings of EMNLP-19