中文

数据驱动模型的效率度量:以文本摘要为例

计算与语言 2020-01-07 v1 机器学习 性能

摘要

近年来,使用数据驱动模型解决文本摘要或类似任务已变得非常普遍。然而大多数研究仅报告基本的准确率分数,对于所提模型在更多数据上训练时能力提升的情况一无所知。在本文中,我们定义并提出了三种数据效率度量:数据分数效率、数据时间亏缺和总体数据效率。我们还提出了一种使用这些度量的简单方案,并将其应用于对文本摘要和标题生成任务上流行方法的更综合评价。对于后者任务,我们处理并发布了一个来自科学文章的包含3500万摘要-标题对的大型集合。我们的结果表明,在测试的模型中,Transformer 在两项任务上均最高效。

关键词

引用

@article{arxiv.1909.06618,
  title  = {Efficiency Metrics for Data-Driven Models: A Text Summarization Case Study},
  author = {Erion Çano and Ondřej Bojar},
  journal= {arXiv preprint arXiv:1909.06618},
  year   = {2020}
}

备注

11 pages, 4 tables, 2 figures, 6 equations. Published in proceedings of INLG 2019, the 12th International Conference on Natural Language Generation, Tokyo, Japan