中文

摘要足以用于假设生成吗?

信息检索 2018-10-23 v3 数字图书馆

摘要

自动假设生成(HG)系统提升研究生产力的潜力与日益增长的公开科学信息量同步。但随着数据更易获取,我们必须理解不同文本数据源对所得假设的影响。摘要对于 HG 是否足够,还是它需要全文论文?HG 系统需要多少篇论文才能做出有价值的预测?通用 HG 系统对超参数值或输入质量的敏感度如何?语料库规模和文档长度对 HG 结果有何影响?为回答这些问题,我们在不同语料库上训练了多个基于知识网络的 HG 系统 Moliere 的版本,以比较结果质量与计算需求方面的挑战与权衡。Moliere 概括了类似基于知识网络的 HG 系统的主要原理,并通过主题建模组件加以强化。语料库包括 PubMed Central 的摘要与全文版本,以及 MEDLINE 的迭代 halves,这使我们能够比较文档长度与数量对结果的影响。我们发现,从定量上看,中位数文档长度更高的语料库产生略高质量的结果,但处理时间显著更长。然而从定性上看,全文论文给所得主题引入了大量干扰项,降低了人工可解释性。此外,我们发现文档长度的影响大于文档数量的影响,即使两组仅包含论文摘要。可复现性:我们的代码与数据分别可在 github.com/jsybran/moliere 与 bit.ly/2GxghpM 获取。

关键词

引用

@article{arxiv.1804.05942,
  title  = {Are Abstracts Enough for Hypothesis Generation?},
  author = {Justin Sybrandt and Angelo Carrabba and Alexander Herzog and Ilya Safro},
  journal= {arXiv preprint arXiv:1804.05942},
  year   = {2018}
}