CA-EHN:源自 E-HowNet 的常识类比
计算与语言
2020-06-01 v5
摘要
嵌入常识知识对于端到端模型将推理泛化至训练语料之外至关重要。然而,现有的词类比数据集往往为手工构建,涉及数百词的排列组合且仅含数十种预定义关系,多为形态关系与命名实体。本工作中,我们通过利用 E-HowNet(一个用结构化义项定义与英文翻译标注 88K 中文词的本体)将常识知识建模至词级类比推理。我们提出 CA-EHN,首个包含 90,505 条类比、覆盖 5,656 词与 763 种关系的常识词类比数据集。实验表明,CA-EHN 是词表示嵌入常识知识程度优劣的极佳指标。该数据集公开于 https://github.com/ckiplab/CA-EHN。
引用
@article{arxiv.1908.07218,
title = {CA-EHN: Commonsense Analogy from E-HowNet},
author = {Peng-Hsuan Li and Tsan-Yu Yang and Wei-Yun Ma},
journal= {arXiv preprint arXiv:1908.07218},
year = {2020}
}
备注
In proceedings of LREC 2020