中文

大规模多语言多模态摘要数据集

计算与语言 2023-02-14 v1 多媒体

摘要

编码器-解码器模型等技术的重要进展使我们能够表示包含多种模态的信息。该信息可进一步增强信息检索和自然语言处理领域的许多下游任务;然而,多模态技术及其性能评估的改进需要具有充分多样性的大规模多模态数据。用于多模态摘要、文本生成和翻译等多种任务的多语言建模利用了从高质量多语言标注数据中提取的信息。在本工作中,我们提出了当前最大的多语言多模态摘要数据集(M3LS),其包含超过一百万个文档-图像对实例,以及每对的专业标注多模态摘要。该数据集源自英国广播公司(BBC)十余年发布的新闻文章,涵盖20种语言,针对五种语系实现多样性,它也是13种语言上最大的摘要数据集,并包含2种语言的跨语言摘要数据。我们利用该数据集正式定义了多语言多模态摘要任务,并报告了多语言设定下多种最先进摘要技术的基线分数。我们还将其与许多类似数据集进行比较,以分析M3LS的独特性和难度。

关键词

引用

@article{arxiv.2302.06560,
  title  = {Large Scale Multi-Lingual Multi-Modal Summarization Dataset},
  author = {Yash Verma and Anubhav Jangra and Raghvendra Kumar and Sriparna Saha},
  journal= {arXiv preprint arXiv:2302.06560},
  year   = {2023}
}