中文

基于文本到文本迁移 Transformer 的短文本关键词抽取

计算与语言 2022-10-18 v2

摘要

本文探讨了文本到文本迁移 Transformer 语言模型(T5)的波兰语版本(plT5)在短文本片段内在与外在关键词抽取任务中的相关性。评估在一个新的波兰开放科学元数据语料库(POSMAC)上进行,该语料库随本文发布:这是在 CURLICAT 项目中编纂的 216,214 篇科学出版物摘要的集合。我们比较了四种不同方法的结果,即 plT5kw、extremeText、TermoPL、KeyBERT,并得出结论:plT5kw 模型对高频和稀疏表示的关键词都产生了尤其有前景的结果。此外,在 POSMAC 上训练的 plT5kw 关键词生成模型在跨域文本标注场景中也似乎产生了高度有用的结果。我们讨论了该模型在新闻故事和基于电话的对话转录上的表现,这些代表了与科学摘要数据集不同的文本体裁和领域。最后,我们也试图刻画在内在与外在关键词抽取上评估文本到文本模型的挑战。

关键词

引用

@article{arxiv.2209.14008,
  title  = {Keyword Extraction from Short Texts with a Text-To-Text Transfer Transformer},
  author = {Piotr Pęzik and Agnieszka Mikołajczyk-Bareła and Adam Wawrzyński and Bartłomiej Nitoń and Maciej Ogrodniczuk},
  journal= {arXiv preprint arXiv:2209.14008},
  year   = {2022}
}

备注

Accepted to ACIIDS 2022. The proceedings of ACIIDS 2022 will be published by Springer in series Lecture Notes in Artificial Intelligence (LNAI) and Communications in Computer and Information Science (CCIS)