TeClass:面向 Telugu 语言的基于相关性的新闻标题分类与生成的人类标注数据集
计算与语言
2024-04-18 v1
摘要
新闻标题生成是提高读者和新闻生产者生产力的关键任务。这一任务可以借助自动化新闻标题生成模型来实现。然而,来自爬取的新闻文章中包含不相关标题的现象会导致生成模型性能 suboptimal。我们提出,相关性基于的标题分类可以大大促进生成相关标题的任务。相关性基于的标题分类涉及根据新闻标题与其对应新闻文章之间的相关性对新闻标题进行分类。虽然这一任务在英语领域已为人所熟知,但由于缺乏标注数据,在资源匮乏的语言(如 Telugu)中仍未得到充分探索。为填补这一空白,我们提出了 TeClass,即首个面向 Telugu 新闻标题分类的数据集,包含 78,534 条标注,覆盖 26,178 篇文章-标题对。我们实验了 various baseline 模型,并对其结果进行全面分析。进一步地,我们通过 TeClass 数据集对 various 标题生成模型进行 fine-tuning。经 TeClass 数据集中高度相关的文章-标题对 fine-tuning 的模型生成的标题,在 ROUGE-L 分数上提升了约 5 分。为鼓励未来研究,我们将公开标注数据集以及标注指南。
引用
@article{arxiv.2404.11349,
title = {TeClass: A Human-Annotated Relevance-based Headline Classification and Generation Dataset for Telugu},
author = {Gopichand Kanumolu and Lokesh Madasu and Nirmal Surange and Manish Shrivastava},
journal= {arXiv preprint arXiv:2404.11349},
year = {2024}
}
备注
Accepted at LREC-COLING 2024