GCDT:面向多体裁与多语言篇章解析的中文 RST 树库
计算与语言
2022-10-20 v1
摘要
大规模人工标注数据的缺乏制约了中文层级篇章解析的发展。本文提出 GCDT,一个基于修辞结构理论(RST)框架、规模最大的普通话中文层级篇章树库。GCDT 覆盖五种自由获取文本体裁、超过 60K 词符,并采用与当代英文 RST 树库相同的关系统计集。我们还报告了该数据集的解析实验,包括利用中英文跨语言训练与多语言嵌入,在中文 RST 解析和英文 GUM 数据集 RST 解析上取得的当前最优(SOTA)结果。
引用
@article{arxiv.2210.10449,
title = {GCDT: A Chinese RST Treebank for Multigenre and Multilingual Discourse Parsing},
author = {Siyao Peng and Yang Janet Liu and Amir Zeldes},
journal= {arXiv preprint arXiv:2210.10449},
year = {2022}
}
备注
Accepted at AACL 2022