中文

评估作者提取库在全球在线新闻文章中的性能

信息检索 2024-10-29 v1 计算与语言

摘要

分析大规模在线新闻内容语料库需要对底层元数据提取方法进行稳健的验证。识别给定网页新闻文章的作者是一项示例,能够启用各种类型的研究问题。虽然存在众多用于离线作者提取的解决方案,但在多语言环境下进行性能比较的工作很少。本文我们构建了一个手动编码的跨语言新闻文章作者数据集,并用于评估五个现有软件包和一个定制模型的性能。我们的评估显示 Go-readability 和 Trafilatura 在作者提取方面最为一致,但我们发现所有软件包在不同语言之间 produce highly variable results。这些发现对于希望在其分析管道中利用作者数据的研究人员而言是相关的,主要表明需要针对特定语言和地区进行进一步的验证才能依赖结果。

关键词

引用

@article{arxiv.2410.19771,
  title  = {Author Unknown: Evaluating Performance of Author Extraction Libraries on Global Online News Articles},
  author = {Sriharsha Hatwar and Virginia Partridge and Rahul Bhargava and Fernando Bermejo},
  journal= {arXiv preprint arXiv:2410.19771},
  year   = {2024}
}