中文

wav2graph: 从语音数据学习知识图谱的监督框架

计算与语言 2024-08-09 v1 人工智能 信息检索 机器学习 声音 音频与语音处理

摘要

知识图谱(KG)通过提供结构化、互相关联的数据,提高了大型语言模型(LLM)和搜索引擎的推理和情境感知能力。然而,知识图谱仅关注文本数据,忽略了语音等其他模态。本文引入wav2graph,首个实现从语音数据学习知识图谱的监督框架。我们的管线包括三个步骤:(1)基于转录的语音文本和命名实体数据库构建知识图谱;(2)将知识图谱转换为嵌入向量;(3)使用图神经网络(GNN)进行节点分类和链路预测任务。通过在归纳和诱导学习情境中使用最先进的GNN模型进行大量实验,我们为人类转录和自动语音识别(ASR)转录的文本上的节点分类和链路预测提供基准结果和错误分析,包括使用编码器和解码器的节点嵌入,以及单语言和多语言声学预训练模型。所有相关代码、数据和模型均已在线发布。

关键词

引用

@article{arxiv.2408.04174,
  title  = {wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech},
  author = {Khai Le-Duc and Quy-Anh Dang and Tan-Hanh Pham and Truong-Son Hy},
  journal= {arXiv preprint arXiv:2408.04174},
  year   = {2024}
}

备注

Preprint, 32 pages