中文

从新闻集合中构建金融交易知识库

信息检索 2017-09-19 v1 计算与语言

摘要

我们致力于解决利用自然语言处理和机器学习技术从大型新闻文章语料库中提取经济事件结构化表示的问题。所开发的技术允许半自动地填充金融知识库,这反过来又可用于支持一系列数据挖掘与探索任务。我们在该领域面临的关键挑战是,同一事件通常被多次报道,且细节的准确性各不相同。我们通过首先从整个语料库中收集与给定事件相关的所有信息,然后考虑该事件的所有可能表示,最后使用监督学习方法根据相关的置信度分数对这些表示进行排序,从而应对这一挑战。我们方法的一个主要创新元素是,它将事件的所有属性作为一个单一表示(五元组)联合提取并存储。使用专门构建的测试集,我们证明了我们的监督学习方法在 F1 分数上比考虑事件最早、最晚或最频繁报道的基线方法提高了 25%。

关键词

引用

@article{arxiv.1709.05743,
  title  = {Towards Building a Knowledge Base of Monetary Transactions from a News Collection},
  author = {Jan R. Benetka and Krisztian Balog and Kjetil Nørvåg},
  journal= {arXiv preprint arXiv:1709.05743},
  year   = {2017}
}

备注

Proceedings of the 17th ACM/IEEE-CS Joint Conference on Digital Libraries (JCDL '17), 2017