中文

利用主观人工标注进行历史报纸文章聚类

信息检索 2012-08-20 v1 计算与语言 数字图书馆

摘要

纽约公共图书馆正在参与“记录美国”计划,旨在开发一个可在线搜索的具有历史意义的报纸文章数据库。报纸的缩微胶卷副本被扫描,并在其上运行高分辨率光学字符识别(OCR)软件。OCR 提取的文本为研究人员和历史学家提供了丰富的数据和观点。然而,OCR 引擎提供的文章分类非常基础,大量文章被标记为社论而没有进一步分组。鉴于语料库的规模,将文章手工分类到细粒度类别即使不是不可能的,也是极其耗时的。本文研究报纸文章自动分类技术,以增强档案的搜索和检索能力。我们探索了无监督(如 KMeans)和半监督(如约束聚类)学习算法,以开发面向最终用户需求的文章分类方案。一项初步研究旨在了解用户对于如何对文章进行分类是否存在一致意见。结果发现该任务具有极强的主观性,因此使用了能够处理主观标签的自动化算法。虽然小规模的初步研究对设计机器学习算法极有帮助,但仍需开发一个更大的系统来收集档案用户的标注。目前正在开发的“BODHI”系统是朝此方向迈出的一步,允许用户纠正扫描错误的 OCR,并为经常使用的报纸文章提供关键词和标签。在该系统的测试版成功实施后,我们希望它能与正在为“记录美国”项目开发的现有软件相集成。

关键词

引用

@article{arxiv.1208.3530,
  title  = {Leveraging Subjective Human Annotation for Clustering Historic Newspaper Articles},
  author = {Haimonti Dutta and William Chan and Deepak Shankargouda and Manoj Pooleery and Axinia Radeva and Kyle Rego and Boyi Xie and Rebecca Passonneau and Austin Lee and Barbara Taranto},
  journal= {arXiv preprint arXiv:1208.3530},
  year   = {2012}
}