中文

用于检索与评估的文本与知识图谱联合表示

计算与语言 2023-03-01 v1

摘要

神经模型的一个关键特征是能够为对象(文本、图像、语音等)生成语义向量表示,确保相似对象在向量空间中彼此接近。尽管大量工作聚焦于学习其他模态的表示,但目前尚无文本与知识库(KB)元素的对齐跨模态表示。学习此类表示的一个挑战是缺乏平行数据,我们通过基于启发式的数据集上的对比训练和数据增强来克服,在(KB 图,文本)对上训练嵌入模型。在更干净的手动构建数据集 WebNLG 上,我们展示了它们学习了适用于检索的对齐表示。随后我们在标注数据上微调以创建 EREDAT(Ensembled Representations for Evaluation of DAta-to-Text),一种英文文本与 KB 图之间的相似度度量。EREDAT 在 WebNLG 上与人类判断的相关性优于或匹配最先进度量,尽管与它们不同,其不需要参考文本进行比较。

关键词

引用

@article{arxiv.2302.14785,
  title  = {Joint Representations of Text and Knowledge Graphs for Retrieval and Evaluation},
  author = {Teven Le Scao and Claire Gardent},
  journal= {arXiv preprint arXiv:2302.14785},
  year   = {2023}
}