中文

文本成员查询

机器学习 2020-08-10 v3 计算与语言 机器学习

摘要

人工数据标注可能非常耗时且昂贵,然而在许多情况下它对学习过程的成功至关重要。为最小化人工标注工作,我们提出一种不依赖现有未标注数据来源的新型主动学习方案。它使用少量标注数据作为核心集,用于合成有用的成员查询(MQs)——即由算法生成供人工标注的未标注实例。我们的方案使用修改算子,即在一定程度上修改实例的函数。我们将算子应用于一小部分实例(核心集),创建一组新的成员查询。利用该框架,我们将实例空间视为搜索空间并应用搜索算法,以生成与学习器高度相关的新示例。我们在文本领域实现了该框架,并在若干文本分类任务上进行了测试,结果表明随着更多 MQs 被标注并纳入训练集,分类器性能得到提升。据我们所知,这是首个关于文本领域成员查询的工作。

关键词

引用

@article{arxiv.1805.04609,
  title  = {Textual Membership Queries},
  author = {Jonathan Zarecki and Shaul Markovitch},
  journal= {arXiv preprint arXiv:1805.04609},
  year   = {2020}
}

备注

Accepted to IJCAI 2020. Code is available at github.com/jonzarecki/textual-mqs . Additional material is available at tinyurl.com/sup-textualmqs . SOLE copyright holder is IJCAI (International Joint Conferences on Artificial Intelligence), all rights reserved