wav2graph: 从语音数据学习知识图谱的监督框架
计算与语言
2024-08-09 v1 人工智能
信息检索
机器学习
声音
音频与语音处理
摘要
知识图谱(KG)通过提供结构化、互相关联的数据,提高了大型语言模型(LLM)和搜索引擎的推理和情境感知能力。然而,知识图谱仅关注文本数据,忽略了语音等其他模态。本文引入wav2graph,首个实现从语音数据学习知识图谱的监督框架。我们的管线包括三个步骤:(1)基于转录的语音文本和命名实体数据库构建知识图谱;(2)将知识图谱转换为嵌入向量;(3)使用图神经网络(GNN)进行节点分类和链路预测任务。通过在归纳和诱导学习情境中使用最先进的GNN模型进行大量实验,我们为人类转录和自动语音识别(ASR)转录的文本上的节点分类和链路预测提供基准结果和错误分析,包括使用编码器和解码器的节点嵌入,以及单语言和多语言声学预训练模型。所有相关代码、数据和模型均已在线发布。
引用
@article{arxiv.2408.04174,
title = {wav2graph: A Framework for Supervised Learning Knowledge Graph from Speech},
author = {Khai Le-Duc and Quy-Anh Dang and Tan-Hanh Pham and Truong-Son Hy},
journal= {arXiv preprint arXiv:2408.04174},
year = {2024}
}
备注
Preprint, 32 pages