Cem Mil Podcasts:一个用于多模态、多语言和多方言信息获取研究的葡萄牙语口语文档语料库
计算与语言
2023-12-14 v2
摘要
在本文中,我们描述了为学术研究目的发布的葡萄牙语播客数据集。我们概述了数据采样方式、该集合的描述性统计,以及巴西和葡萄牙方言的分布信息。我们给出了多语言摘要实验的结果,表明由一个同时支持英语和葡萄牙语的系统对播客转录文本进行摘要可取得良好效果。我们还展示了利用文本元数据对葡萄牙语播客体裁进行分类的实验。将该集合与之前发布的英语语言集合相结合,为多模态、多语言和多方言播客信息获取研究开辟了潜力。
引用
@article{arxiv.2209.11871,
title = {Cem Mil Podcasts: A Spoken Portuguese Document Corpus For Multi-modal, Multi-lingual and Multi-Dialect Information Access Research},
author = {Ekaterina Garmash and Edgar Tanaka and Ann Clifton and Joana Correia and Sharmistha Jat and Winstead Zhu and Rosie Jones and Jussi Karlgren},
journal= {arXiv preprint arXiv:2209.11871},
year = {2023}
}
备注
12 pages, 1 figure