中文

基于辅助集生成与协同扩展的语料库集合扩展引导

计算与语言 2020-01-29 v1

摘要

给定一小组种子实体(例如“USA”、“Russia”),基于语料库的集合扩展是从给定语料库中归纳出一组共享相同语义类(本例中为国家)的广泛实体。集合扩展惠及知识发现中广泛的下游应用,如网页搜索、分类体系构建和查询建议。现有的基于语料库的集合扩展算法通常通过结合词汇模式与分布相似性来引导给定种子。然而,由于未显式提供负集,这些方法因在无引导下自由扩展种子集而遭受语义漂移之苦。我们提出一个新框架 Set-CoExpan,其自动生成作为负集且与用户感兴趣目标集紧密相关的辅助集,然后执行多集协同扩展,通过目标集与辅助集比较提取判别性特征,形成彼此区分的多个凝聚集,从而解决语义漂移问题。本文中我们证明,通过生成辅助集,可引导目标集的扩展过程避免触及与辅助集边界附近的模糊区域,并展示 Set-CoExpan 显著优于强基线方法。

关键词

引用

@article{arxiv.2001.10106,
  title  = {Guiding Corpus-based Set Expansion by Auxiliary Sets Generation and Co-Expansion},
  author = {Jiaxin Huang and Yiqing Xie and Yu Meng and Jiaming Shen and Yunyi Zhang and Jiawei Han},
  journal= {arXiv preprint arXiv:2001.10106},
  year   = {2020}
}

备注

WWW 2020