利用预训练上下文词表示从文本预测韵律突显
计算与语言
2019-08-07 v1
摘要
本文介绍一个新的自然语言处理数据集与基准,用于从书面文本预测韵律突显。据我们所知,这将是公开可用的最大的带韵律标注的数据集。我们详细描述数据集构建及所得基准数据集,并训练了从基于特征的分类器到用于预测离散化韵律突显的神经网络系统的多种不同模型。我们表明,来自BERT的预训练上下文词表示以不到10%的训练数据便优于其他模型。最后我们结合结果讨论该数据集,并指出未来研究方向及进一步改进从文本预测韵律突显的数据集与方法的计划。数据集与模型代码均已公开可用。
引用
@article{arxiv.1908.02262,
title = {Predicting Prosodic Prominence from Text with Pre-trained Contextualized Word Representations},
author = {Aarne Talman and Antti Suni and Hande Celikkanat and Sofoklis Kakouros and Jörg Tiedemann and Martti Vainio},
journal= {arXiv preprint arXiv:1908.02262},
year = {2019}
}
备注
NoDaLiDa 2019 camera ready