关注标签:用预训练模型描述知识图谱中的关系
计算与语言
2023-10-27 v3
摘要
用于数据到文本(D2T)生成的预训练语言模型(PLMs)可利用人类可读的数据标签(如列标题、键或关系名)泛化至域外示例。然而,若这些标签模糊或不完整(在 D2T 数据集中常如此),已知模型会产生语义不准确的输出。本文中,我们在描述两实体间关系的任务上揭示了该问题。为实验,我们收集了一个新数据集,用于 verbalizing 来自三个大规模知识图谱(Wikidata、DBPedia、YAGO)的 1,522 种独特关系的多样集合。我们发现,尽管用于 D2T 生成的 PLMs 在不清澈案例中预期失败,但以大量多样关系标签训练的模型在 verbalizing 新颖、未见关系时出奇地鲁棒。我们主张,使用具有多样清晰且有意义标签的数据是训练能够泛化至新颖领域的 D2T 生成系统的关键。
引用
@article{arxiv.2210.07373,
title = {Mind the Labels: Describing Relations in Knowledge Graphs With Pretrained Models},
author = {Zdeněk Kasner and Ioannis Konstas and Ondřej Dušek},
journal= {arXiv preprint arXiv:2210.07373},
year = {2023}
}
备注
Long paper at EACL '23. Code and data: https://github.com/kasnerz/rel2text